3 октября 2026 г. · Редакция Тераферма
Как запустить Llama на арендованной GPU: vLLM и Ollama по шагам
Чтобы запустить Llama на арендованной GPU, достаточно взять сервер с RTX 3090 или RTX 4090 (22–44 ₽/час), установить Ollama одной командой или vLLM через pip и скачать модель — весь путь занимает 10–15 минут. Для Llama 8B хватает 24 ГБ видеопамяти, для 70B в 4 битах нужна карта на 48–80 ГБ.
Ниже — пошаговая инструкция с командами, которые можно копировать: от выбора карты до работающего API, совместимого с OpenAI.
Шаг 1. Выбираем видеокарту под модель
Главное для LLM — объём видеопамяти. Грубая формула: в 16 битах модель занимает около 2 ГБ на каждый миллиард параметров, в 4 битах — около 0,6 ГБ. Сверху нужен запас под KV-кеш, то есть контекст, — от 1–2 ГБ до десятков гигабайт при длинных запросах и многих пользователях.
| Модель | Точность | Память под веса | Подходящая карта | Цена, ₽/час |
|---|---|---|---|---|
| Llama 3.2 3B | FP16 | ~7 ГБ | RTX 3060 12 ГБ | 10 |
| Llama 3.1 8B | 4 бита (Ollama) | ~5 ГБ | RTX 3060 12 ГБ | 10 |
| Llama 3.1 8B | FP16 | ~16 ГБ | RTX 3090 / RTX 4090 | 22 / 44 |
| Llama 3.3 70B | 4 бита | ~40 ГБ | RTX A6000 48 ГБ / A100 80 ГБ | 60 / 102 |
| Llama 3.3 70B | FP8 | ~70 ГБ | H100 80 ГБ | 255 |
Для экспериментов с 8B оптимальна RTX 3090: 24 ГБ за 22 ₽/час. Если нужна максимальная скорость ответа, берите RTX 4090. Подробно о подборе карты под разные модели — в статье какую видеокарту выбрать для LLM.
Шаг 2. Запускаем сервер и подключаемся
В каталоге аренды GPU для ИИ выберите карту и запустите сервер. Задайте диск с запасом: веса 8B в FP16 весят около 16 ГБ, 70B в 4 битах — около 40 ГБ. Плюс место под окружение Python, кеш pip и сами логи. Для 70B разумно брать от 150 ГБ.
Подключитесь по SSH и проверьте, что видеокарта на месте:
nvidia-smi
Вы должны увидеть название карты, объём памяти и версию драйвера. Если команда сработала, можно ставить софт.
Шаг 3. Самый быстрый путь: Ollama
Ollama — это обёртка над llama.cpp, которая сама скачивает квантизированные модели и запускает их одной командой. Подходит для личного использования, тестов промптов и небольших ботов.
Установка:
curl -fsSL https://ollama.com/install.sh | sh
Запуск модели в интерактивном режиме:
ollama run llama3.1:8b
При первом запуске Ollama скачает около 5 ГБ весов в 4-битной квантизации, и через минуту-две можно писать запросы прямо в терминале. Для выхода наберите /bye.
По умолчанию Ollama берёт квантизацию Q4_K_M — разумный компромисс между качеством и размером. Если памяти с запасом, например на RTX 4090, можно взять более точную версию: в библиотеке Ollama у каждой модели есть теги с вариантами вроде q8_0 или fp16. Разница в качестве ответов на простых задачах обычно невелика, а на сложных рассуждениях и коде 8-битная версия заметно стабильнее 4-битной.
Чтобы использовать модель из своего кода, Ollama поднимает HTTP API на порту 11434. Если сервис не стартовал автоматически, запустите его вручную:
ollama serve &
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1:8b",
"prompt": "Объясни, что такое KV-кеш, в двух предложениях",
"stream": false
}'
Для 70B на A100 или A6000 команда та же, меняется только имя модели:
ollama run llama3.3:70b
Минус Ollama — производительность при параллельных запросах. Если к модели одновременно обращаются 10–20 пользователей, ответы начинают заметно тормозить. Для такой нагрузки нужен vLLM.
Шаг 4. Для API и нагрузки: vLLM
vLLM — сервер инференса, который за счёт PagedAttention и непрерывного батчинга обрабатывает много запросов одновременно. Он отдаёт API в формате OpenAI, поэтому существующий код на библиотеке openai работает без переделок, нужно только поменять адрес.
Перед установкой коротко о том, чем инструменты отличаются на практике:
| Критерий | Ollama | vLLM |
|---|---|---|
| Установка | одна команда | pip, токен Hugging Face, параметры |
| Формат моделей | GGUF, готовые квантизации | веса Hugging Face, AWQ, GPTQ, FP8 |
| Один пользователь | быстро | быстро |
| 10–50 параллельных запросов | заметно проседает | основной сценарий, высокая пропускная способность |
| API | собственный и OpenAI-совместимый | OpenAI-совместимый |
| Для чего брать | тесты, личный ассистент, прототип | API для продукта, пакетная обработка данных |
Если вы не уверены, начните с Ollama: за пять минут станет понятно, устраивает ли вас качество модели. Переходить на vLLM имеет смысл, когда модель выбрана и нужна скорость под нагрузкой.
Установка в виртуальном окружении:
python3 -m venv ~/vllm && source ~/vllm/bin/activate
pip install -U pip
pip install vllm
Модели Llama на Hugging Face закрыты лицензионным соглашением. Примите его на странице модели, создайте токен в настройках аккаунта и авторизуйтесь на сервере:
pip install -U huggingface_hub
hf auth login
Запуск Llama 3.1 8B на RTX 3090 или 4090:
vllm serve meta-llama/Llama-3.1-8B-Instruct \
--max-model-len 8192 \
--gpu-memory-utilization 0.90 \
--port 8000
Параметр --max-model-len ограничивает длину контекста. По умолчанию vLLM пытается выделить память под полный контекст модели в 128 тысяч токенов, и на 24 ГБ это не помещается. Для большинства задач 8–16 тысяч токенов хватает с головой.
Для Llama 70B на A100 80GB удобно взять готовую 4-битную AWQ-версию:
vllm serve hugging-quants/Meta-Llama-3.1-70B-Instruct-AWQ-INT4 \
--max-model-len 8192 \
--port 8000
Проверка, что сервер отвечает:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "meta-llama/Llama-3.1-8B-Instruct",
"messages": [{"role": "user", "content": "Привет! Кто ты?"}],
"max_tokens": 200
}'
Подключаемся к модели со своего компьютера
Открывать порт модели в интернет без авторизации не стоит: любой, кто найдёт адрес, сможет пользоваться вашей видеокартой за ваши деньги. Безопаснее пробросить порт через SSH-туннель. На своём компьютере выполните:
ssh -L 8000:localhost:8000 -p <порт> root@<адрес-сервера>
Пока сессия открыта, API доступен у вас локально по адресу http://localhost:8000. Пример на Python:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="none")
resp = client.chat.completions.create(
model="meta-llama/Llama-3.1-8B-Instruct",
messages=[{"role": "user", "content": "Составь план статьи о GPU"}],
)
print(resp.choices[0].message.content)
Если API нужен постоянно, например для чат-бота, запустите vLLM с ключом --api-key и поставьте перед ним обратный прокси с HTTPS.
Веб-интерфейс в стиле ChatGPT
Если с моделью будут работать люди, а не код, удобно поставить Open WebUI. Это веб-интерфейс с историей чатов, загрузкой файлов и выбором модели. Он подключается и к Ollama, и к vLLM через OpenAI-совместимый адрес.
docker run -d -p 3000:8080 \
-e OPENAI_API_BASE_URL=http://host.docker.internal:8000/v1 \
-e OPENAI_API_KEY=none \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui ghcr.io/open-webui/open-webui:main
Пробросьте порт 3000 через SSH так же, как 8000, и откройте http://localhost:3000 в браузере. При первом входе интерфейс попросит создать учётную запись администратора — она хранится только на вашем сервере.
Такая связка закрывает типичную задачу небольшой команды: закрытый чат на открытой модели, где данные не уходят во внешние сервисы. Документы, код и переписка остаются на арендованном сервере и удаляются вместе с ним.
Частые ошибки и как их исправить
CUDA out of memory при старте vLLM. Уменьшите --max-model-len, снизьте --gpu-memory-utilization до 0.85 или возьмите квантизированную версию модели. Если не помогает — нужна карта с большим объёмом памяти.
Ошибка 401 или 403 при скачивании модели. Вы не приняли лицензию Llama на Hugging Face или не авторизовались токеном. Проверьте командой hf auth whoami.
Модель долго скачивается. Веса 70B — это десятки гигабайт, и минуты аренды идут, пока они загружаются. Если вы работаете с моделью регулярно, храните её на постоянном диске, а не скачивайте при каждом запуске.
Генерация медленнее, чем ожидалось. Посмотрите в nvidia-smi, где лежит модель. Если часть слоёв не поместилась в видеопамять, Ollama молча выгружает их в оперативную память, и скорость падает в разы. Решение — более сжатая квантизация или карта с большим объёмом памяти.
vLLM ругается на версию CUDA или PyTorch. Чаще всего это конфликт с уже установленными пакетами. Ставьте vLLM в чистое виртуальное окружение, как в инструкции выше, или используйте официальный Docker-образ vllm/vllm-openai, где всё собрано заранее.
После перезапуска сервера пропал кеш моделей. Модели Hugging Face по умолчанию лежат в ~/.cache/huggingface, модели Ollama — в ~/.ollama. Если эти папки находятся на временном диске, при пересоздании сервера их придётся скачивать заново. Переложите кеш на постоянный диск через переменные HF_HOME и OLLAMA_MODELS.
Ответы на русском хуже, чем ожидалось. Llama обучена в основном на английском. Для русскоязычных задач стоит сравнить её с Qwen 2.5 или дообученными русскими версиями: запускаются они теми же командами, меняется только имя модели. Как дообучить модель на своих данных, мы описали в статье про LoRA и QLoRA на арендованной GPU.
Сколько это стоит на практике
Несколько реальных сценариев по тарифам Тераферма:
- Вечер экспериментов с промптами на Llama 8B через Ollama, RTX 3090, 3 часа — 66 ₽.
- Тестовый API для команды на vLLM, RTX 4090, рабочий день 8 часов — 352 ₽.
- Прогон 70B на датасете для оценки качества, A100, 5 часов — 510 ₽.
- Бот 24/7 на RTX 3090 — около 15 800 ₽ в месяц. При постоянной нагрузке стоит сравнить с выделенным сервером, расчёт в статье почасовая аренда или выделенный сервер.
Для сравнения стоит держать в голове цену альтернативы. Платный API крупной модели берёт деньги за каждый токен, и при больших объёмах, например при разметке сотен тысяч документов, счёт быстро растёт. Собственная модель на арендованной карте стоит фиксированные рубли в час, сколько бы токенов она ни сгенерировала. При пакетной обработке через vLLM одна RTX 4090 за час успевает обработать очень большой объём текста, и стоимость тысячи токенов выходит копеечной.
Оплата поминутная, картой российского банка. Закончили — остановили сервер, и списание прекратилось.
Итог
Запустить Llama на арендованной видеокарте проще, чем кажется: Ollama даёт работающую модель за пару минут, vLLM — производительный API в формате OpenAI за 10–15 минут. Для 8B берите RTX 3090 или 4090 с 24 ГБ, для 70B — A100 80GB или RTX A6000. В Тераферме все эти карты доступны с поминутной оплатой в рублях: запустите сервер, скопируйте команды из этой статьи и проверьте свою модель уже сегодня. Если вы ещё сравниваете площадки, загляните в обзор облачных GPU в России в 2026 году: там собраны критерии, по которым стоит выбирать сервис.