3 октября 2026 г. · Редакция Тераферма
Сколько стоит обучить нейросеть: считаем GPU-часы и цену в рублях
Стоимость обучения нейросети считается по одной формуле: GPU-часы × цена часа. На практике это от 11 ₽ за дообучение небольшого классификатора текстов на RTX 3090 до 200 ₽ за QLoRA модели 8B на RTX 4090 и от 21 тысячи рублей за обучение языковой модели на 1 млрд параметров с нуля на H100.
Ниже — как оценить GPU-часы до запуска, какие цифры получаются для типовых задач и как снизить итоговый счёт.
Формула: GPU-часы × цена часа
Всё, что влияет на стоимость обучения, сводится к двум числам.
Цена часа — тариф на выбранную видеокарту. В Тераферме, например: RTX 3090 — 22 ₽, RTX 4090 — 44 ₽, RTX A6000 — 60 ₽, A100 80GB — 102 ₽, H100 — 255 ₽, H200 — 534 ₽, B200 — 884 ₽ за час. Полный список — на странице цен.
GPU-часы — сколько часов работы видеокарты нужно для задачи. Если обучение идёт на 4 картах 10 часов, это 40 GPU-часов.
Цена часа известна заранее. Самое сложное — оценить GPU-часы. Для этого есть два способа: теоретический расчёт и пробный запуск.
Как оценить GPU-часы теоретически
Для трансформеров, включая языковые модели, есть известная оценка вычислительных затрат на обучение:
Вычисления (FLOP) ≈ 6 × N × D
где N — число параметров модели, D — число токенов в обучающих данных. Множитель 6 учитывает прямой и обратный проход.
Дальше делим вычисления на реальную производительность карты. Реальная — это паспортная, умноженная на MFU (model FLOPs utilization), долю мощности, которую обучение использует на практике. Для хорошо настроенного обучения MFU обычно составляет 30–50%, для небрежно написанного кода может быть 10–20%.
| Карта | Паспортная FP16/BF16, TFLOPS | Реально при MFU 40% | Цена, ₽/час |
|---|---|---|---|
| RTX 4090 | ~165 | ~66 | 44 |
| A100 80GB | ~312 | ~125 | 102 |
| H100 | ~989 | ~395 | 255 |
Пример: модель 1B с нуля
Возьмём модель на 1 млрд параметров и 20 млрд токенов данных — примерно 20 токенов на параметр, такое соотношение часто используют как разумный ориентир.
Вычисления: 6 × 10⁹ × 2 × 10¹⁰ = 1,2 × 10²⁰ FLOP.
- H100: 1,2 × 10²⁰ ÷ 3,95 × 10¹⁴ ≈ 304 000 секунд ≈ 84 часа × 255 ₽ ≈ 21 500 ₽
- A100: 1,2 × 10²⁰ ÷ 1,25 × 10¹⁴ ≈ 960 000 секунд ≈ 267 часов × 102 ₽ ≈ 27 200 ₽
- RTX 4090: 1,2 × 10²⁰ ÷ 6,6 × 10¹³ ≈ 1 818 000 секунд ≈ 505 часов × 44 ₽ ≈ 22 200 ₽
Интересный вывод: по деньгам H100 и RTX 4090 почти сравнялись, но на H100 обучение займёт 3,5 суток на одной карте, а на 4090 — три недели. А на 8 картах H100 — меньше 11 часов при той же стоимости. Плюс у RTX 4090 всего 24 ГБ, и для моделей крупнее 1B полное обучение на ней уже не поместится. Подробное сравнение карт — в статье H100 vs A100 vs RTX 4090.
Пример: модель 7B с нуля
7 млрд параметров на 100 млрд токенов: 6 × 7 × 10⁹ × 10¹¹ = 4,2 × 10²¹ FLOP.
На H100 при MFU 40%: около 10,6 млн секунд, то есть примерно 2 950 GPU-часов. Стоимость — около 750 000 ₽. На кластере из 8 H100 это около 15 суток.
Это уже серьёзный проект, и обычно его не делают без веских причин. Для большинства прикладных задач выгоднее взять готовую открытую модель и дообучить её.
Типовые задачи и их стоимость
Обучение с нуля — редкость. Чаще всего обучают небольшие модели или дообучают готовые. Вот ориентиры по тарифам Тераферма. Время — оценочное, для типичных объёмов данных.
| Задача | Карта | GPU-часы | Стоимость |
|---|---|---|---|
| Дообучение BERT-классификатора, 50 тыс. текстов | RTX 3090 | ~0,5 | ~11 ₽ |
| Дообучение YOLO на своём датасете, 5 тыс. картинок | RTX 4090 | 2–4 | 88–176 ₽ |
| LoRA для SDXL, 30 картинок | RTX 4090 | 0,5–1 | 22–44 ₽ |
| QLoRA модели 8B, 10 тыс. примеров | RTX 4090 | 3–5 | 132–220 ₽ |
| QLoRA модели 70B, 5 тыс. примеров | A100 80GB | 12–20 | 1 224–2 040 ₽ |
| Полное дообучение 8B, 50 млн токенов × 3 эпохи | 4 × H100 | ~6–10 | 1 530–2 550 ₽ |
| Модель 1B с нуля, 20 млрд токенов | H100 | ~85–100 | 21 700–25 500 ₽ |
Видно, что для большинства бизнес-задач — классификация, распознавание объектов, дообучение LLM на своих данных — стоимость обучения измеряется сотнями рублей, а не сотнями тысяч. Как именно запускать дообучение LLM, мы описали в статье дообучение LoRA и QLoRA на арендованной GPU.
Пробный запуск: самый точный способ
Теоретическая оценка хороша для планирования, но реальное время зависит от множества деталей: длины последовательностей, загрузки данных, оптимизаций, версии библиотек. Самый надёжный способ — короткий пробный запуск.
- Подготовьте данные и скрипт обучения заранее, без видеокарты.
- Запустите сервер с нужной картой и прогоните 50–100 шагов.
- Посмотрите в логах скорость: секунд на шаг или токенов в секунду.
- Посчитайте: (всего шагов × секунд на шаг) ÷ 3 600 = часы обучения.
- Умножьте на цену часа и добавьте запас 10–20% на валидацию и сохранение чекпоинтов.
Пример. Вы дообучаете модель 8B через QLoRA на RTX 4090. Датасет — 12 000 примеров, батч с учётом накопления градиентов — 16, три эпохи. Получается 12 000 ÷ 16 × 3 = 2 250 шагов. Пробный запуск показал 6 секунд на шаг. Итого 2 250 × 6 = 13 500 секунд, то есть 3,75 часа. С запасом 20% — 4,5 часа × 44 ₽ = 198 ₽. Если тот же пробный запуск на RTX 3090 показал 10 секунд на шаг, обучение займёт 6,25 часа, а с запасом — 7,5 часа × 22 ₽ = 165 ₽. Дешевле, но результат будет готов на три часа позже.
Пробный запуск занимает 10–15 минут. При поминутной оплате это 5–11 ₽ на RTX 3090 или 4090 и около 60 ₽ на H100. Зато вы точно знаете, сколько стоит вся задача, и можете сравнить несколько карт. Подробнее об оплате — на странице почасовой аренды GPU.
Что ещё входит в бюджет, кроме самого обучения
Расчёт по формуле даёт стоимость одного успешного прогона. В реальном проекте прогонов почти всегда больше, и это стоит заложить в бюджет заранее.
Эксперименты. Редко получается подобрать гиперпараметры с первого раза. Скорость обучения, размер батча, ранг LoRA, длина контекста — обычно приходится сделать 3–10 коротких прогонов, прежде чем запускать основной. Хорошее правило — закладывать на эксперименты ещё 50–100% от стоимости финального обучения.
Оценка качества. После обучения модель нужно прогнать на тестовой выборке, а для LLM — ещё и сгенерировать ответы на контрольные вопросы. Это тоже GPU-время, хоть и небольшое.
Неудачные запуски. Ошибка в данных, обнаруженная на середине обучения, означает, что половина GPU-часов ушла впустую. Проверяйте данные и скрипт на маленьком подмножестве до большого запуска.
Хранение и передача данных. Датасеты и чекпоинты больших моделей занимают сотни гигабайт. Скачивание и загрузка идут, пока сервер включён, и это тоже оплачиваемые минуты.
Инференс после обучения. Обучить модель — полдела, её ещё нужно где-то запускать. Если модель будет работать постоянно, посчитайте и эту часть бюджета: сравнение почасовой аренды и постоянного сервера разобрано в статье почасовая аренда GPU или выделенный сервер.
На практике итоговый бюджет проекта обычно в 1,5–3 раза больше стоимости одного финального прогона. Для дообучения 8B это всё равно сотни рублей, а не тысячи.
Как снизить стоимость обучения
Смешанная точность. Обучение в BF16 вместо FP32 ускоряет работу в несколько раз на тензорных ядрах и почти не влияет на качество. На H100 и картах Ada и Blackwell можно идти дальше, в FP8.
Высокий MFU. Проверьте загрузку видеокарты через nvidia-smi. Если она ниже 80–90%, узкое место не в GPU: ускорьте загрузку данных, увеличьте число воркеров DataLoader, держите данные на быстром SSD.
Правильный метод. LoRA и QLoRA обучают доли процента параметров и сокращают память и время в разы. Полное дообучение имеет смысл только тогда, когда LoRA не даёт нужного качества.
Подходящая карта. Не берите H100 для задачи, которая помещается в RTX 4090 и не ограничена сроками. И наоборот: не мучайте 24 ГБ моделью, которой нужно 80, — время на обходные пути стоит дороже.
Чекпоинты. Сохраняйте промежуточные результаты каждые 30–60 минут. Сбой без чекпоинтов означает, что все потраченные GPU-часы придётся оплатить заново.
Отлаживайте на маленьком. Ошибки в скрипте ловите на крошечной модели и сотне примеров на дешёвой карте, а дорогую карту запускайте, когда всё работает.
Итог
Сколько стоит обучить нейросеть — вопрос арифметики: GPU-часы × цена часа. GPU-часы можно оценить по формуле 6 × N × D с поправкой на реальную производительность или точнее — пробным запуском на 50–100 шагов. Большинство прикладных задач обходится в десятки и сотни рублей, дообучение крупных моделей — в тысячи, и только обучение LLM с нуля требует серьёзного бюджета. Не забывайте закладывать запас на эксперименты и неудачные прогоны: в реальном проекте их почти всегда больше одного, и честный бюджет учитывает это с самого начала.
В Тераферме доступны карты от RTX 3060 за 10 ₽/час до B200 за 884 ₽/час, с поминутной оплатой картой российского банка. Посчитайте свою задачу, сделайте пробный запуск и платите только за реальные минуты обучения. Каталог карт — в разделе аренды GPU для ИИ.