3 октября 2026 г. · Редакция Тераферма
Аренда видеокарты для нейросети: какую GPU выбрать под задачу и бюджет
Для большинства нейросетевых задач хватает одной арендованной видеокарты с 12–24 ГБ памяти: RTX 3060 за 10 ₽ в час подойдёт для Stable Diffusion 1.5, RTX 3090 за 22 ₽ — для SDXL, LoRA и LLM до 30B в 4 битах. Карты уровня A100 и H100 нужны, только когда модель не помещается в 24–48 ГБ или обучение идёт сутками.
Ниже — как подобрать GPU под конкретную задачу и не переплатить.
Главное правило: сначала память, потом скорость
Нейросеть должна целиком поместиться в видеопамять вместе с промежуточными данными. Если не помещается, получите ошибку CUDA out of memory, и никакая скорость ядер не поможет. Если помещается с запасом, выбираете по соотношению цены и скорости.
Отсюда простой порядок:
- Оцените, сколько памяти нужно вашей задаче.
- Отберите карты, у которых памяти хватает.
- Среди них возьмите ту, что даст результат дешевле всего.
Пункт три не всегда означает «самую дешёвую в час». Более быстрая карта может закончить работу вдвое раньше и выйти дешевле по итогу.
Чтобы ориентироваться в объёмах памяти, держите под рукой таблицу:
| Видеокарта | VRAM | Цена, ₽/час |
|---|---|---|
| RTX 3060 | 12 ГБ | 10 |
| RTX A4000 | 16 ГБ | 13 |
| RTX 4060 Ti | 16 ГБ | 15 |
| RTX 5070 Ti | 16 ГБ | 23 |
| RTX 3090 | 24 ГБ | 22 |
| RTX 4090 | 24 ГБ | 44 |
| RTX 5090 | 32 ГБ | 70 |
| RTX A6000 | 48 ГБ | 60 |
| L40S | 48 ГБ | 102 |
| A100 | 80 ГБ | 102 |
| H100 | 80 ГБ | 255 |
Подбор карты под конкретную задачу
Генерация изображений: Stable Diffusion, SDXL, Flux
Генерация картинок — самый частый повод арендовать GPU. Требования по памяти здесь умеренные, а скорость заметно влияет на удобство: ждать каждую картинку по 30 секунд утомительно.
Stable Diffusion 1.5. Работает на 8 ГБ, комфортно на 12 ГБ. RTX 3060 за 10 ₽ в час — разумный старт для экспериментов и обучения новичков.
SDXL. Базовая генерация 1024×1024 укладывается в 10–12 ГБ, но с ControlNet, рефайнером и апскейлом удобнее 16–24 ГБ. Оптимальный выбор — RTX 3090 за 22 ₽.
Flux. Тяжелее SDXL. Полная версия в 16-битной точности требует около 24 ГБ и больше, квантованные варианты запускаются на 12–16 ГБ, но медленнее. Для работы без компромиссов берите RTX 4090 или RTX 5090.
Видео-модели. Генерация коротких роликов открытыми моделями обычно требует 24 ГБ и выше, а лучше 32–48 ГБ. Здесь хорошо показывают себя RTX 5090 и RTX A6000.
Практический совет: если вы генерируете сотни изображений для проекта, сравните скорость. RTX 4090 генерирует SDXL-картинку примерно в 1,5–2 раза быстрее RTX 3090. При цене в два раза выше итоговая стоимость партии получается сопоставимой, зато вы экономите собственное время.
Обучение LoRA и дообучение моделей
LoRA — способ дообучить большую модель под свой стиль, персонажа или домен, меняя небольшую долю параметров. Это дешевле и быстрее полного обучения.
LoRA для Stable Diffusion 1.5. Хватит 12 ГБ. На RTX 3060 обучение на 20–30 изображениях занимает порядка часа.
LoRA для SDXL. Нужно от 16 ГБ, лучше 24 ГБ. На RTX 4090 типичный прогон — 1–2 часа, то есть 44–88 ₽.
LoRA и QLoRA для языковых моделей. QLoRA для модели 7–8B помещается в 12–16 ГБ. Модель 13–14B требует около 16–24 ГБ. Для 70B в режиме QLoRA понадобится карта с 48 ГБ: RTX A6000 за 60 ₽ в час или A100.
Полное дообучение. Здесь память нужна на веса, градиенты и состояния оптимизатора. Ориентир — около 16 байт на параметр при смешанной точности с Adam. Модель 7B в таком режиме требует свыше 100 ГБ, то есть нескольких A100 или H100. Если бюджет ограничен, почти всегда разумнее остаться на LoRA.
Подробный расчёт памяти под языковые модели с формулами и таблицей — в статье сколько видеопамяти нужно для LLM.
Инференс языковых моделей
Запустить открытую LLM у себя полезно, если нельзя отправлять данные во внешние сервисы, нужна дообученная модель или вы тестируете несколько моделей перед выбором.
Ориентиры для квантования 4 бита:
- 7–8B (Llama 3.1 8B, Qwen 7B): 6–8 ГБ, работает на RTX 3060.
- 13–14B: около 10–12 ГБ, комфортно на 16 ГБ.
- 30–32B: около 20 ГБ, нужна карта с 24 ГБ, а с длинным контекстом — RTX 5090 с 32 ГБ.
- 70B: около 40–45 ГБ, подойдёт RTX A6000 или A100.
Для сервиса, который отвечает многим пользователям одновременно, нужен запас памяти под KV-кэш. Здесь выигрывают карты с большим объёмом: A100 с 80 ГБ или H100. Подробнее о выборе между профессиональными и игровыми картами — на странице аренды GPU для ИИ.
Речь, зрение и другие задачи
Нейросети — это не только картинки и чат-боты. Ещё несколько популярных сценариев, под которые арендуют GPU:
Распознавание речи. Модели семейства Whisper в большой версии занимают около 10 ГБ в 16-битной точности. Расшифровка часовой записи на RTX 3090 занимает несколько минут. Если нужно обработать архив подкастов или звонков на сотни часов, аренда на вечер обойдётся в сотню-другую рублей.
Компьютерное зрение. Обучение детекторов объектов семейства YOLO на собственном датасете комфортно идёт на 12–24 ГБ. Здесь важен не столько объём памяти, сколько скорость чтения данных: держите датасет на локальном SSD машины, а не подгружайте по сети на каждой эпохе.
Синтез речи и клонирование голоса. Обучение голосовых моделей обычно укладывается в 12–16 ГБ, подойдёт RTX 4060 Ti за 15 ₽ в час или RTX A4000 за 13 ₽.
Эмбеддинги и поиск. Если нужно один раз превратить миллион документов в векторы для поиска, мощная карта на пару часов выгоднее, чем неделя на CPU.
Готовые сценарии с ценами
Чтобы было проще прикинуть бюджет, вот несколько типовых задач.
| Задача | Рекомендуемая карта | Время | Примерная стоимость |
|---|---|---|---|
| 200 картинок SDXL | RTX 3090 | ~1 час | ~22 ₽ |
| LoRA для SDXL на 30 фото | RTX 4090 | 1–2 часа | 44–88 ₽ |
| QLoRA для 8B на 10 тыс. примеров | RTX 4090 | 2–4 часа | 88–176 ₽ |
| Тест модели 70B в 4 битах | RTX A6000 | 2 часа | ~120 ₽ |
| Дообучение 7B полностью | 2× A100 | 8–12 часов | 1 630–2 450 ₽ |
Цифры ориентировочные: многое зависит от размера датасета, разрешения, длины контекста и настроек. Но порядок величин честный. Большинство задач энтузиаста или небольшой команды стоят десятки и сотни рублей, а не тысячи.
Если работа идёт короткими сессиями, обратите внимание на почасовую аренду GPU: списание поминутное, поэтому 10-минутный тест не превращается в оплату полного часа.
Как подготовиться к запуску и не переплатить
Самое дорогое в аренде — минуты, когда карта работает вхолостую, пока вы что-то настраиваете. Несколько привычек сокращают их почти до нуля.
Соберите всё в один скрипт. Установка зависимостей, загрузка данных, запуск обучения и выгрузка результата. Запустили и ушли, а не набираете команды по одной.
Выберите шаблон с нужной версией CUDA и PyTorch. Сборка окружения с нуля может занять 15–20 минут. Готовый шаблон стартует за минуту.
Сжимайте датасет. Архив из тысяч мелких файлов загружается быстрее, чем те же файлы по одному.
Включите сохранение чекпойнтов. Если обучение длится часами, сохраняйте промежуточные веса. Так прерванный прогон можно продолжить, а не начинать заново.
Следите за загрузкой GPU. Команда nvidia-smi показывает, насколько занята карта. Если загрузка держится на 30–40%, узкое место в подаче данных или в процессоре, и платить за более мощную карту бессмысленно.
Ещё несколько способов сэкономить
Не держите машину включённой между сессиями. Подготовили данные, запустили обучение, выгрузили результат, остановили. Пауза на обед на RTX 4090 стоит около 30 ₽, на H100 — больше 200 ₽.
Отлаживайте на дешёвой карте. Ошибки в коде одинаково падают на RTX 3060 и на A100. Сначала прогоните скрипт на маленьком куске данных на карте за 10–15 ₽, а потом запускайте полное обучение на мощной.
Используйте смешанную точность. Режимы bf16 и fp16 сокращают расход памяти и ускоряют обучение на картах RTX 30-й серии и новее.
Квантуйте для инференса. Модель в 4 битах занимает примерно в четыре раза меньше памяти, чем в 16 битах, а качество для большинства прикладных задач падает незначительно.
Сравнивайте цену за результат. RTX 5090 стоит 70 ₽ в час, но если она закончит задачу за час вместо трёх на RTX 3090, по деньгам выйдет почти вровень (70 ₽ против 66 ₽), а два часа вы сэкономите. Разбор этой карты — в материале RTX 5090 для ИИ: стоит ли арендовать.
Почему арендовать в России удобнее на Тераферме
Зарубежные площадки вроде Vast.ai и RunPod существуют, но не принимают российские карты, а оплата через посредников добавляет комиссии и задержки. На Тераферме всё проще:
- оплата картой российского банка, расчёты в рублях;
- поминутная тарификация, без минимального срока;
- выбор от RTX 3060 до H200 и B200;
- готовые шаблоны с PyTorch, Jupyter и инструментами для генерации изображений.
Если вы впервые сталкиваетесь с арендой, начните со статьи что такое аренда GPU: там разобран первый запуск по шагам.
Итог
Выбор видеокарты для нейросети сводится к двум вопросам: сколько памяти нужно и сколько вы готовы ждать. Для генерации картинок и LoRA хватает RTX 3090 или 4090. Для LLM до 32B — RTX 5090. Для 70B и серьёзного обучения — A6000, A100 и выше.
Начните с недорогой карты, отладьте процесс, а затем масштабируйтесь. Каталог конфигураций и актуальные цены — в разделе аренды GPU.