Тераферма Регистрация

3 октября 2026 г. · Редакция Тераферма

H100 vs A100 vs RTX 4090: что выбрать для обучения и инференса нейросетей

Три видеокарты H100, A100 и RTX 4090 рядом на схеме сравнения

Для обучения больших моделей выбирайте H100 (255 ₽/час), для задач, где нужны 80 ГБ памяти за разумные деньги, — A100 (102 ₽/час), а для инференса моделей до 13B, Stable Diffusion и дообучения через LoRA — RTX 4090 (44 ₽/час). Правильный выбор зависит не от того, какая карта мощнее, а от того, сколько стоит результат: обученная эпоха, тысяча токенов или сотня картинок.

Разберём, чем отличаются эти три карты, где каждая выигрывает и как посчитать, какая обойдётся дешевле именно для вашей задачи.

Характеристики: H100, A100 и RTX 4090 в одной таблице

Параметр H100 SXM A100 80GB RTX 4090
Архитектура Hopper (2022) Ampere (2020) Ada Lovelace (2022)
Видеопамять 80 ГБ HBM3 80 ГБ HBM2e 24 ГБ GDDR6X
Пропускная способность памяти ~3,35 ТБ/с ~2 ТБ/с ~1 ТБ/с
FP16 тензорные, TFLOPS (паспорт) ~989 ~312 ~165
Поддержка FP8 да нет да
NVLink да да нет
Потребление до 700 Вт до 400 Вт до 450 Вт
Цена в Тераферме 255 ₽/час 102 ₽/час 44 ₽/час

Паспортные терафлопсы — это потолок, который реальный код достигает редко. Но соотношение показательно: по чистой математике H100 примерно втрое быстрее A100 и в шесть раз быстрее RTX 4090. При этом стоит она в 2,5 и 5,8 раза дороже соответственно.

Ещё важнее память. У H100 и A100 по 80 ГБ, у RTX 4090 — 24 ГБ. Это граница, которую не обойти никакой скоростью: если модель не помещается, она просто не запустится или будет работать через медленную выгрузку в оперативную память.

Обучение: где каждая карта окупается

H100: когда считается каждый час

H100 создана для обучения трансформеров. Поддержка FP8 и Transformer Engine позволяют на совместимых фреймворках ускорить обучение ещё сильнее. На реальных задачах предобучения и полного файнтюнинга LLM разница с A100 обычно составляет 2–3 раза.

Посчитаем на примере. Допустим, полное дообучение модели 7B на вашем датасете занимает 30 часов на A100. На H100 это будет около 12–15 часов.

  • A100: 30 × 102 = 3 060 ₽
  • H100: 13 × 255 = 3 315 ₽

Цена почти одинаковая, но на H100 результат готов вдвое быстрее. Если ваш код хорошо использует тензорные ядра и смешанную точность, H100 часто выходит даже дешевле. Если код упирается в загрузку данных или процессор, переплата за H100 не окупится.

A100: 80 ГБ за умеренные деньги

A100 — рабочая лошадка, на которой обучили большую часть известных моделей 2020–2023 годов. Её главное преимущество сегодня — 80 ГБ памяти по 102 ₽/час. Это позволяет:

  • полностью дообучать модели до 7B с оптимизаторами в смешанной точности;
  • делать LoRA на моделях до 70B в 4 битах;
  • обучать модели компьютерного зрения с большим батчем;
  • работать с длинным контекстом, где растёт KV-кеш.

Подробнее о карте — на странице аренды A100.

RTX 4090: дообучение и эксперименты

На RTX 4090 полное обучение даже 7B модели не поместится: только веса в FP16 занимают около 14 ГБ, а градиенты и состояние оптимизатора требуют ещё в 2–3 раза больше. Зато QLoRA для моделей 7–13B идёт на ней отлично, а по скорости в этих задачах 4090 нередко не сильно уступает A100.

Пример: QLoRA для Llama 3 8B на датасете в 10 000 примеров за 3 эпохи занимает около 3–5 часов на RTX 4090. Это 130–220 ₽. Та же задача на A100 будет немного быстрее, но обойдётся в 250–400 ₽. Пошаговый разбор — в статье про дообучение LoRA на арендованной GPU.

Инференс: скорость генерации токенов

Для инференса LLM главный параметр — пропускная способность памяти. Каждый сгенерированный токен требует прочитать все веса модели, поэтому скорость генерации для одного пользователя упирается именно в ТБ/с, а не в терафлопсы.

Задача Лучший выбор Почему
Llama 3 8B, один пользователь RTX 4090 хватает памяти, высокая скорость, 44 ₽/час
Qwen 32B в 4 битах RTX 4090 или RTX 5090 ~20 ГБ весов помещаются в 24–32 ГБ
Llama 70B в 4 битах A100 80GB ~40 ГБ весов плюс место под контекст
Llama 70B, много пользователей H100 высокая пропускная способность и FP8
Модели 100B+ H200, B200 или несколько H100 нужно больше 80 ГБ

Для API с десятками одновременных пользователей H100 с vLLM обрабатывает в разы больше запросов в секунду, чем A100, за счёт памяти HBM3 и FP8. Для личного чат-бота или тестов это избыточно, и RTX 4090 справится за долю цены. Как развернуть модель на арендованной карте, описано в инструкции как запустить Llama на арендованной GPU.

Генерация изображений и видео

Для Stable Diffusion, SDXL и Flux серверные карты почти никогда не нужны. RTX 4090 в этих задачах — одна из самых быстрых карт на рынке, а 24 ГБ хватает для Flux в FP8 и большинства рабочих процессов в ComfyUI.

A100 и H100 имеют смысл только для генерации видео тяжёлыми моделями или для очень больших пакетов, где нужна память под батч. Подробно о выборе карты под генерацию — в статье Stable Diffusion, SDXL, Flux: какая видеокарта нужна.

Подводные камни, о которых забывают

Таблица характеристик не рассказывает всего. Несколько моментов, которые влияют на итоговую цену задачи сильнее, чем терафлопсы.

Программная поддержка FP8. Главное ускорение H100 над A100 достигается в FP8 через Transformer Engine. Если ваш фреймворк или модель его не используют, вы получите прирост скорее в 1,5–2 раза, а не в 3. Проверьте, поддерживает ли ваш стек FP8, прежде чем рассчитывать на максимальную выгоду.

Узкое место в данных. Если датасет состоит из миллионов мелких картинок и читается с диска медленно, видеокарта будет простаивать в ожидании. Быстрая H100 в таком случае простаивает дороже. Сначала проверьте загрузку GPU командой nvidia-smi: если она держится ниже 70–80%, проблема не в карте.

Размер батча. На RTX 4090 с 24 ГБ приходится уменьшать батч и включать накопление градиентов. Это работает, но немного замедляет обучение и иногда требует подбирать гиперпараметры заново. На 80 ГБ вы просто ставите нужный размер батча.

Масштабирование на несколько карт. У A100 и H100 есть NVLink — быстрая связь между картами в одном сервере. У RTX 4090 его нет, и при обучении на 2–4 картах обмен градиентами идёт через PCIe. Для LoRA это почти не важно, для полного обучения больших моделей — критично.

Длинный контекст. При инференсе с контекстом 32–128 тысяч токенов KV-кеш занимает гигабайты памяти на каждого пользователя. Модель, которая формально помещается в 24 ГБ, с длинным контекстом может перестать помещаться. Здесь 80 ГБ A100 и H100 дают запас, которого у потребительских карт нет.

Как посчитать, какая карта выгоднее

Формула простая: стоимость задачи = время на карте × цена часа. Сравнивать нужно итоговую стоимость, а не цену часа.

Практический способ:

  1. Запустите задачу на 10–15 минут на RTX 4090 и замерьте скорость: шагов в секунду, токенов в секунду или картинок в минуту.
  2. Сделайте то же на A100 или H100.
  3. Пересчитайте время всей задачи и умножьте на тариф.

Благодаря поминутной оплате такой тест обходится в 10–60 ₽ на каждую карту. Это дешевле, чем выбрать неправильно и переплатить за десятки часов.

Разберём на условном примере. Вы дообучаете модель классификации текстов. Пробный запуск показал:

Карта Скорость, шагов/с Время на 50 000 шагов Цена часа Стоимость задачи
RTX 4090 4,0 ~3,5 часа 44 ₽ ~154 ₽
A100 80GB 5,5 ~2,5 часа 102 ₽ ~255 ₽
H100 11,0 ~1,3 часа 255 ₽ ~330 ₽

Цифры скорости здесь иллюстративные, у вашей модели они будут другими. Но логика показательна: для небольшой задачи, которая помещается в память RTX 4090, самый дешёвый результат даёт именно она. H100 выигрывает по времени почти втрое, и если результат нужен через час, а не к вечеру, доплата в 175 ₽ может быть оправдана.

Теперь представим, что модель в 10 раз больше и на RTX 4090 не помещается вовсе. Выбор сужается до A100 и H100, и здесь при хорошей загрузке тензорных ядер H100 часто оказывается выгоднее по итоговой стоимости, несмотря на тариф в 2,5 раза выше.

Несколько эмпирических правил:

  • задача помещается в 24 ГБ — почти всегда начинайте с RTX 4090;
  • нужно 40–80 ГБ, а скорость не критична — A100;
  • обучение на десятки и сотни часов с хорошо оптимизированным кодом — H100;
  • промежуточный вариант на 48 ГБ — RTX A6000 за 60 ₽/час или L40S за 102 ₽/час.

Итог

H100, A100 и RTX 4090 не конкурируют напрямую, а закрывают разные задачи. RTX 4090 — для инференса до 13–30B, генерации изображений и LoRA. A100 — когда нужны 80 ГБ без переплаты. H100 — для серьёзного обучения, где ускорение в 2–3 раза окупает тариф.

В Тераферме все три карты доступны с поминутной оплатой картой РФ: можно протестировать свою задачу на каждой за несколько десятков рублей и выбрать ту, что даёт лучший результат за рубль. Каталог и цены — на страницах аренды GPU для ИИ и RTX 4090.

Вопросы по теме

Что быстрее для обучения нейросети: H100 или A100?

H100 по паспорту выдаёт около 989 TFLOPS в FP16 против 312 у A100, а на практике обучение трансформеров на ней идёт примерно в 2–3 раза быстрее. При цене 255 ₽/час против 102 ₽/час H100 выгоднее, если задача действительно упирается в вычисления.

Можно ли обучать LLM на RTX 4090?

Да, если модель и метод помещаются в 24 ГБ: QLoRA и LoRA для моделей до 13B, полное обучение небольших моделей до 1–2B параметров. Для полного обучения 7B и больше нужна память A100 или H100.

Какая карта лучше для инференса Llama 70B?

В 4-битной квантизации модель 70B занимает около 40 ГБ и помещается на одну A100 80GB или H100. На одной RTX 4090 с 24 ГБ она не поместится, нужно минимум две карты.

Почему A100 до сих пор популярна, если есть H100?

A100 даёт те же 80 ГБ памяти в 2,5 раза дешевле H100. Для задач, где важен объём памяти, а не пиковая скорость, она остаётся самым выгодным вариантом.

Подберите GPU

20 моделей с поминутной оплатой картой РФ.