Тераферма Регистрация

3 октября 2026 г. · Редакция Тераферма

Сколько стоит обучить нейросеть: считаем GPU-часы и цену в рублях

Калькулятор и график GPU-часов для оценки стоимости обучения нейросети

Стоимость обучения нейросети считается по одной формуле: GPU-часы × цена часа. На практике это от 11 ₽ за дообучение небольшого классификатора текстов на RTX 3090 до 200 ₽ за QLoRA модели 8B на RTX 4090 и от 21 тысячи рублей за обучение языковой модели на 1 млрд параметров с нуля на H100.

Ниже — как оценить GPU-часы до запуска, какие цифры получаются для типовых задач и как снизить итоговый счёт.

Формула: GPU-часы × цена часа

Всё, что влияет на стоимость обучения, сводится к двум числам.

Цена часа — тариф на выбранную видеокарту. В Тераферме, например: RTX 3090 — 22 ₽, RTX 4090 — 44 ₽, RTX A6000 — 60 ₽, A100 80GB — 102 ₽, H100 — 255 ₽, H200 — 534 ₽, B200 — 884 ₽ за час. Полный список — на странице цен.

GPU-часы — сколько часов работы видеокарты нужно для задачи. Если обучение идёт на 4 картах 10 часов, это 40 GPU-часов.

Цена часа известна заранее. Самое сложное — оценить GPU-часы. Для этого есть два способа: теоретический расчёт и пробный запуск.

Как оценить GPU-часы теоретически

Для трансформеров, включая языковые модели, есть известная оценка вычислительных затрат на обучение:

Вычисления (FLOP) ≈ 6 × N × D

где N — число параметров модели, D — число токенов в обучающих данных. Множитель 6 учитывает прямой и обратный проход.

Дальше делим вычисления на реальную производительность карты. Реальная — это паспортная, умноженная на MFU (model FLOPs utilization), долю мощности, которую обучение использует на практике. Для хорошо настроенного обучения MFU обычно составляет 30–50%, для небрежно написанного кода может быть 10–20%.

Карта Паспортная FP16/BF16, TFLOPS Реально при MFU 40% Цена, ₽/час
RTX 4090 ~165 ~66 44
A100 80GB ~312 ~125 102
H100 ~989 ~395 255

Пример: модель 1B с нуля

Возьмём модель на 1 млрд параметров и 20 млрд токенов данных — примерно 20 токенов на параметр, такое соотношение часто используют как разумный ориентир.

Вычисления: 6 × 10⁹ × 2 × 10¹⁰ = 1,2 × 10²⁰ FLOP.

  • H100: 1,2 × 10²⁰ ÷ 3,95 × 10¹⁴ ≈ 304 000 секунд ≈ 84 часа × 255 ₽ ≈ 21 500 ₽
  • A100: 1,2 × 10²⁰ ÷ 1,25 × 10¹⁴ ≈ 960 000 секунд ≈ 267 часов × 102 ₽ ≈ 27 200 ₽
  • RTX 4090: 1,2 × 10²⁰ ÷ 6,6 × 10¹³ ≈ 1 818 000 секунд ≈ 505 часов × 44 ₽ ≈ 22 200 ₽

Интересный вывод: по деньгам H100 и RTX 4090 почти сравнялись, но на H100 обучение займёт 3,5 суток на одной карте, а на 4090 — три недели. А на 8 картах H100 — меньше 11 часов при той же стоимости. Плюс у RTX 4090 всего 24 ГБ, и для моделей крупнее 1B полное обучение на ней уже не поместится. Подробное сравнение карт — в статье H100 vs A100 vs RTX 4090.

Пример: модель 7B с нуля

7 млрд параметров на 100 млрд токенов: 6 × 7 × 10⁹ × 10¹¹ = 4,2 × 10²¹ FLOP.

На H100 при MFU 40%: около 10,6 млн секунд, то есть примерно 2 950 GPU-часов. Стоимость — около 750 000 ₽. На кластере из 8 H100 это около 15 суток.

Это уже серьёзный проект, и обычно его не делают без веских причин. Для большинства прикладных задач выгоднее взять готовую открытую модель и дообучить её.

Типовые задачи и их стоимость

Обучение с нуля — редкость. Чаще всего обучают небольшие модели или дообучают готовые. Вот ориентиры по тарифам Тераферма. Время — оценочное, для типичных объёмов данных.

Задача Карта GPU-часы Стоимость
Дообучение BERT-классификатора, 50 тыс. текстов RTX 3090 ~0,5 ~11 ₽
Дообучение YOLO на своём датасете, 5 тыс. картинок RTX 4090 2–4 88–176 ₽
LoRA для SDXL, 30 картинок RTX 4090 0,5–1 22–44 ₽
QLoRA модели 8B, 10 тыс. примеров RTX 4090 3–5 132–220 ₽
QLoRA модели 70B, 5 тыс. примеров A100 80GB 12–20 1 224–2 040 ₽
Полное дообучение 8B, 50 млн токенов × 3 эпохи 4 × H100 ~6–10 1 530–2 550 ₽
Модель 1B с нуля, 20 млрд токенов H100 ~85–100 21 700–25 500 ₽

Видно, что для большинства бизнес-задач — классификация, распознавание объектов, дообучение LLM на своих данных — стоимость обучения измеряется сотнями рублей, а не сотнями тысяч. Как именно запускать дообучение LLM, мы описали в статье дообучение LoRA и QLoRA на арендованной GPU.

Пробный запуск: самый точный способ

Теоретическая оценка хороша для планирования, но реальное время зависит от множества деталей: длины последовательностей, загрузки данных, оптимизаций, версии библиотек. Самый надёжный способ — короткий пробный запуск.

  1. Подготовьте данные и скрипт обучения заранее, без видеокарты.
  2. Запустите сервер с нужной картой и прогоните 50–100 шагов.
  3. Посмотрите в логах скорость: секунд на шаг или токенов в секунду.
  4. Посчитайте: (всего шагов × секунд на шаг) ÷ 3 600 = часы обучения.
  5. Умножьте на цену часа и добавьте запас 10–20% на валидацию и сохранение чекпоинтов.

Пример. Вы дообучаете модель 8B через QLoRA на RTX 4090. Датасет — 12 000 примеров, батч с учётом накопления градиентов — 16, три эпохи. Получается 12 000 ÷ 16 × 3 = 2 250 шагов. Пробный запуск показал 6 секунд на шаг. Итого 2 250 × 6 = 13 500 секунд, то есть 3,75 часа. С запасом 20% — 4,5 часа × 44 ₽ = 198 ₽. Если тот же пробный запуск на RTX 3090 показал 10 секунд на шаг, обучение займёт 6,25 часа, а с запасом — 7,5 часа × 22 ₽ = 165 ₽. Дешевле, но результат будет готов на три часа позже.

Пробный запуск занимает 10–15 минут. При поминутной оплате это 5–11 ₽ на RTX 3090 или 4090 и около 60 ₽ на H100. Зато вы точно знаете, сколько стоит вся задача, и можете сравнить несколько карт. Подробнее об оплате — на странице почасовой аренды GPU.

Что ещё входит в бюджет, кроме самого обучения

Расчёт по формуле даёт стоимость одного успешного прогона. В реальном проекте прогонов почти всегда больше, и это стоит заложить в бюджет заранее.

Эксперименты. Редко получается подобрать гиперпараметры с первого раза. Скорость обучения, размер батча, ранг LoRA, длина контекста — обычно приходится сделать 3–10 коротких прогонов, прежде чем запускать основной. Хорошее правило — закладывать на эксперименты ещё 50–100% от стоимости финального обучения.

Оценка качества. После обучения модель нужно прогнать на тестовой выборке, а для LLM — ещё и сгенерировать ответы на контрольные вопросы. Это тоже GPU-время, хоть и небольшое.

Неудачные запуски. Ошибка в данных, обнаруженная на середине обучения, означает, что половина GPU-часов ушла впустую. Проверяйте данные и скрипт на маленьком подмножестве до большого запуска.

Хранение и передача данных. Датасеты и чекпоинты больших моделей занимают сотни гигабайт. Скачивание и загрузка идут, пока сервер включён, и это тоже оплачиваемые минуты.

Инференс после обучения. Обучить модель — полдела, её ещё нужно где-то запускать. Если модель будет работать постоянно, посчитайте и эту часть бюджета: сравнение почасовой аренды и постоянного сервера разобрано в статье почасовая аренда GPU или выделенный сервер.

На практике итоговый бюджет проекта обычно в 1,5–3 раза больше стоимости одного финального прогона. Для дообучения 8B это всё равно сотни рублей, а не тысячи.

Как снизить стоимость обучения

Смешанная точность. Обучение в BF16 вместо FP32 ускоряет работу в несколько раз на тензорных ядрах и почти не влияет на качество. На H100 и картах Ada и Blackwell можно идти дальше, в FP8.

Высокий MFU. Проверьте загрузку видеокарты через nvidia-smi. Если она ниже 80–90%, узкое место не в GPU: ускорьте загрузку данных, увеличьте число воркеров DataLoader, держите данные на быстром SSD.

Правильный метод. LoRA и QLoRA обучают доли процента параметров и сокращают память и время в разы. Полное дообучение имеет смысл только тогда, когда LoRA не даёт нужного качества.

Подходящая карта. Не берите H100 для задачи, которая помещается в RTX 4090 и не ограничена сроками. И наоборот: не мучайте 24 ГБ моделью, которой нужно 80, — время на обходные пути стоит дороже.

Чекпоинты. Сохраняйте промежуточные результаты каждые 30–60 минут. Сбой без чекпоинтов означает, что все потраченные GPU-часы придётся оплатить заново.

Отлаживайте на маленьком. Ошибки в скрипте ловите на крошечной модели и сотне примеров на дешёвой карте, а дорогую карту запускайте, когда всё работает.

Итог

Сколько стоит обучить нейросеть — вопрос арифметики: GPU-часы × цена часа. GPU-часы можно оценить по формуле 6 × N × D с поправкой на реальную производительность или точнее — пробным запуском на 50–100 шагов. Большинство прикладных задач обходится в десятки и сотни рублей, дообучение крупных моделей — в тысячи, и только обучение LLM с нуля требует серьёзного бюджета. Не забывайте закладывать запас на эксперименты и неудачные прогоны: в реальном проекте их почти всегда больше одного, и честный бюджет учитывает это с самого начала.

В Тераферме доступны карты от RTX 3060 за 10 ₽/час до B200 за 884 ₽/час, с поминутной оплатой картой российского банка. Посчитайте свою задачу, сделайте пробный запуск и платите только за реальные минуты обучения. Каталог карт — в разделе аренды GPU для ИИ.

Вопросы по теме

Как посчитать стоимость обучения нейросети?

Умножьте число GPU-часов на цену часа выбранной карты. GPU-часы можно оценить по формуле 6 × число параметров × число токенов, делённой на реальную производительность карты, или замерить пробным запуском на 50–100 шагов.

Сколько стоит дообучить языковую модель на своих данных?

QLoRA для модели 7–8B на 10 000 примеров занимает 3–5 часов на RTX 4090 и стоит 130–220 ₽ по тарифам Тераферма. Дообучение 70B через QLoRA на A100 обходится в 1–2 тысячи рублей.

Сколько стоит обучить LLM с нуля?

Модель на 1 млрд параметров на 20 млрд токенов требует порядка 80–100 часов H100 — около 21–26 тысяч рублей. Модель 7B на 100 млрд токенов — уже около 3 000 часов H100, порядка 750 тысяч рублей.

Что такое MFU и почему оно важно для расчёта?

MFU — доля паспортной производительности GPU, которую реально использует обучение. Обычно это 30–50%. Чем выше MFU, тем меньше GPU-часов и денег уходит на ту же задачу.

Подберите GPU

20 моделей с поминутной оплатой картой РФ.