3 октября 2026 г. · Редакция Тераферма
H100 vs A100 vs RTX 4090: что выбрать для обучения и инференса нейросетей
Для обучения больших моделей выбирайте H100 (255 ₽/час), для задач, где нужны 80 ГБ памяти за разумные деньги, — A100 (102 ₽/час), а для инференса моделей до 13B, Stable Diffusion и дообучения через LoRA — RTX 4090 (44 ₽/час). Правильный выбор зависит не от того, какая карта мощнее, а от того, сколько стоит результат: обученная эпоха, тысяча токенов или сотня картинок.
Разберём, чем отличаются эти три карты, где каждая выигрывает и как посчитать, какая обойдётся дешевле именно для вашей задачи.
Характеристики: H100, A100 и RTX 4090 в одной таблице
| Параметр | H100 SXM | A100 80GB | RTX 4090 |
|---|---|---|---|
| Архитектура | Hopper (2022) | Ampere (2020) | Ada Lovelace (2022) |
| Видеопамять | 80 ГБ HBM3 | 80 ГБ HBM2e | 24 ГБ GDDR6X |
| Пропускная способность памяти | ~3,35 ТБ/с | ~2 ТБ/с | ~1 ТБ/с |
| FP16 тензорные, TFLOPS (паспорт) | ~989 | ~312 | ~165 |
| Поддержка FP8 | да | нет | да |
| NVLink | да | да | нет |
| Потребление | до 700 Вт | до 400 Вт | до 450 Вт |
| Цена в Тераферме | 255 ₽/час | 102 ₽/час | 44 ₽/час |
Паспортные терафлопсы — это потолок, который реальный код достигает редко. Но соотношение показательно: по чистой математике H100 примерно втрое быстрее A100 и в шесть раз быстрее RTX 4090. При этом стоит она в 2,5 и 5,8 раза дороже соответственно.
Ещё важнее память. У H100 и A100 по 80 ГБ, у RTX 4090 — 24 ГБ. Это граница, которую не обойти никакой скоростью: если модель не помещается, она просто не запустится или будет работать через медленную выгрузку в оперативную память.
Обучение: где каждая карта окупается
H100: когда считается каждый час
H100 создана для обучения трансформеров. Поддержка FP8 и Transformer Engine позволяют на совместимых фреймворках ускорить обучение ещё сильнее. На реальных задачах предобучения и полного файнтюнинга LLM разница с A100 обычно составляет 2–3 раза.
Посчитаем на примере. Допустим, полное дообучение модели 7B на вашем датасете занимает 30 часов на A100. На H100 это будет около 12–15 часов.
- A100: 30 × 102 = 3 060 ₽
- H100: 13 × 255 = 3 315 ₽
Цена почти одинаковая, но на H100 результат готов вдвое быстрее. Если ваш код хорошо использует тензорные ядра и смешанную точность, H100 часто выходит даже дешевле. Если код упирается в загрузку данных или процессор, переплата за H100 не окупится.
A100: 80 ГБ за умеренные деньги
A100 — рабочая лошадка, на которой обучили большую часть известных моделей 2020–2023 годов. Её главное преимущество сегодня — 80 ГБ памяти по 102 ₽/час. Это позволяет:
- полностью дообучать модели до 7B с оптимизаторами в смешанной точности;
- делать LoRA на моделях до 70B в 4 битах;
- обучать модели компьютерного зрения с большим батчем;
- работать с длинным контекстом, где растёт KV-кеш.
Подробнее о карте — на странице аренды A100.
RTX 4090: дообучение и эксперименты
На RTX 4090 полное обучение даже 7B модели не поместится: только веса в FP16 занимают около 14 ГБ, а градиенты и состояние оптимизатора требуют ещё в 2–3 раза больше. Зато QLoRA для моделей 7–13B идёт на ней отлично, а по скорости в этих задачах 4090 нередко не сильно уступает A100.
Пример: QLoRA для Llama 3 8B на датасете в 10 000 примеров за 3 эпохи занимает около 3–5 часов на RTX 4090. Это 130–220 ₽. Та же задача на A100 будет немного быстрее, но обойдётся в 250–400 ₽. Пошаговый разбор — в статье про дообучение LoRA на арендованной GPU.
Инференс: скорость генерации токенов
Для инференса LLM главный параметр — пропускная способность памяти. Каждый сгенерированный токен требует прочитать все веса модели, поэтому скорость генерации для одного пользователя упирается именно в ТБ/с, а не в терафлопсы.
| Задача | Лучший выбор | Почему |
|---|---|---|
| Llama 3 8B, один пользователь | RTX 4090 | хватает памяти, высокая скорость, 44 ₽/час |
| Qwen 32B в 4 битах | RTX 4090 или RTX 5090 | ~20 ГБ весов помещаются в 24–32 ГБ |
| Llama 70B в 4 битах | A100 80GB | ~40 ГБ весов плюс место под контекст |
| Llama 70B, много пользователей | H100 | высокая пропускная способность и FP8 |
| Модели 100B+ | H200, B200 или несколько H100 | нужно больше 80 ГБ |
Для API с десятками одновременных пользователей H100 с vLLM обрабатывает в разы больше запросов в секунду, чем A100, за счёт памяти HBM3 и FP8. Для личного чат-бота или тестов это избыточно, и RTX 4090 справится за долю цены. Как развернуть модель на арендованной карте, описано в инструкции как запустить Llama на арендованной GPU.
Генерация изображений и видео
Для Stable Diffusion, SDXL и Flux серверные карты почти никогда не нужны. RTX 4090 в этих задачах — одна из самых быстрых карт на рынке, а 24 ГБ хватает для Flux в FP8 и большинства рабочих процессов в ComfyUI.
A100 и H100 имеют смысл только для генерации видео тяжёлыми моделями или для очень больших пакетов, где нужна память под батч. Подробно о выборе карты под генерацию — в статье Stable Diffusion, SDXL, Flux: какая видеокарта нужна.
Подводные камни, о которых забывают
Таблица характеристик не рассказывает всего. Несколько моментов, которые влияют на итоговую цену задачи сильнее, чем терафлопсы.
Программная поддержка FP8. Главное ускорение H100 над A100 достигается в FP8 через Transformer Engine. Если ваш фреймворк или модель его не используют, вы получите прирост скорее в 1,5–2 раза, а не в 3. Проверьте, поддерживает ли ваш стек FP8, прежде чем рассчитывать на максимальную выгоду.
Узкое место в данных. Если датасет состоит из миллионов мелких картинок и читается с диска медленно, видеокарта будет простаивать в ожидании. Быстрая H100 в таком случае простаивает дороже. Сначала проверьте загрузку GPU командой nvidia-smi: если она держится ниже 70–80%, проблема не в карте.
Размер батча. На RTX 4090 с 24 ГБ приходится уменьшать батч и включать накопление градиентов. Это работает, но немного замедляет обучение и иногда требует подбирать гиперпараметры заново. На 80 ГБ вы просто ставите нужный размер батча.
Масштабирование на несколько карт. У A100 и H100 есть NVLink — быстрая связь между картами в одном сервере. У RTX 4090 его нет, и при обучении на 2–4 картах обмен градиентами идёт через PCIe. Для LoRA это почти не важно, для полного обучения больших моделей — критично.
Длинный контекст. При инференсе с контекстом 32–128 тысяч токенов KV-кеш занимает гигабайты памяти на каждого пользователя. Модель, которая формально помещается в 24 ГБ, с длинным контекстом может перестать помещаться. Здесь 80 ГБ A100 и H100 дают запас, которого у потребительских карт нет.
Как посчитать, какая карта выгоднее
Формула простая: стоимость задачи = время на карте × цена часа. Сравнивать нужно итоговую стоимость, а не цену часа.
Практический способ:
- Запустите задачу на 10–15 минут на RTX 4090 и замерьте скорость: шагов в секунду, токенов в секунду или картинок в минуту.
- Сделайте то же на A100 или H100.
- Пересчитайте время всей задачи и умножьте на тариф.
Благодаря поминутной оплате такой тест обходится в 10–60 ₽ на каждую карту. Это дешевле, чем выбрать неправильно и переплатить за десятки часов.
Разберём на условном примере. Вы дообучаете модель классификации текстов. Пробный запуск показал:
| Карта | Скорость, шагов/с | Время на 50 000 шагов | Цена часа | Стоимость задачи |
|---|---|---|---|---|
| RTX 4090 | 4,0 | ~3,5 часа | 44 ₽ | ~154 ₽ |
| A100 80GB | 5,5 | ~2,5 часа | 102 ₽ | ~255 ₽ |
| H100 | 11,0 | ~1,3 часа | 255 ₽ | ~330 ₽ |
Цифры скорости здесь иллюстративные, у вашей модели они будут другими. Но логика показательна: для небольшой задачи, которая помещается в память RTX 4090, самый дешёвый результат даёт именно она. H100 выигрывает по времени почти втрое, и если результат нужен через час, а не к вечеру, доплата в 175 ₽ может быть оправдана.
Теперь представим, что модель в 10 раз больше и на RTX 4090 не помещается вовсе. Выбор сужается до A100 и H100, и здесь при хорошей загрузке тензорных ядер H100 часто оказывается выгоднее по итоговой стоимости, несмотря на тариф в 2,5 раза выше.
Несколько эмпирических правил:
- задача помещается в 24 ГБ — почти всегда начинайте с RTX 4090;
- нужно 40–80 ГБ, а скорость не критична — A100;
- обучение на десятки и сотни часов с хорошо оптимизированным кодом — H100;
- промежуточный вариант на 48 ГБ — RTX A6000 за 60 ₽/час или L40S за 102 ₽/час.
Итог
H100, A100 и RTX 4090 не конкурируют напрямую, а закрывают разные задачи. RTX 4090 — для инференса до 13–30B, генерации изображений и LoRA. A100 — когда нужны 80 ГБ без переплаты. H100 — для серьёзного обучения, где ускорение в 2–3 раза окупает тариф.
В Тераферме все три карты доступны с поминутной оплатой картой РФ: можно протестировать свою задачу на каждой за несколько десятков рублей и выбрать ту, что даёт лучший результат за рубль. Каталог и цены — на страницах аренды GPU для ИИ и RTX 4090.