Тераферма Регистрация

3 октября 2026 г. · Редакция Тераферма

Какую видеокарту выбрать для LLM и Stable Diffusion

Видеокарты разного размера и объём памяти под языковые модели

Главный критерий выбора видеокарты для нейросетей — объём видеопамяти. Языковая модель в FP16 занимает около 2 ГБ на миллиард параметров, в 4-битной квантизации — около 0,6 ГБ. Для моделей до 8B хватит 12–16 ГБ, для 32B — 24 ГБ (RTX 3090/4090), для 70B — 48 ГБ и больше.

Почему память важнее TFLOPS

Чтобы модель работала быстро, все её веса должны лежать в памяти видеокарты. Если не помещаются — часть уходит в оперативную память, и скорость падает в десятки раз. Поэтому RTX 3090 с 24 ГБ для LLM часто полезнее, чем более быстрая RTX 4080 с 16 ГБ.

Вторая по важности характеристика — пропускная способность памяти. При генерации текста карта на каждом токене прочитывает все веса модели, и именно скорость чтения определяет, сколько токенов в секунду вы получите. У RTX 4090 это около 1 ТБ/с, у H100 — 3,35 ТБ/с.

Сколько памяти нужно под популярные модели

МодельFP164 битаПодойдёт
Llama 3.1 8B, Qwen 2.5 7B~16 ГБ~5 ГБRTX 3060 12 ГБ и выше
Qwen 2.5 14B, Phi-4~28 ГБ~9 ГБRTX 4060 Ti 16 ГБ, RTX 3090
Qwen 2.5 32B, Gemma 2 27B~64 ГБ~20 ГБRTX 3090, 4090, 5090
Llama 3.3 70B, Qwen 2.5 72B~140 ГБ~42 ГБRTX A6000, L40S, A100, H100

Без учёта KV-кэша: длинный контекст требует ещё несколько гигабайт.

Какие видеокарты что тянут

ВидеокартаПамятьLLM в 4 битах, доАренда от
RTX 306012 ГБ17 млрд10 ₽/ч
RTX 4060 Ti16 ГБ22 млрд15 ₽/ч
RTX 309024 ГБ34 млрд22 ₽/ч
RTX 409024 ГБ34 млрд44 ₽/ч
RTX 509032 ГБ45 млрд70 ₽/ч
RTX A600048 ГБ68 млрд60 ₽/ч
A10080 ГБ113 млрд102 ₽/ч
H10080 ГБ113 млрд255 ₽/ч
H200141 ГБ199 млрд534 ₽/ч

Stable Diffusion, SDXL и Flux

Для генерации изображений память тоже решает, но требования скромнее. Stable Diffusion 1.5 работает на 8 ГБ, SDXL комфортно — на 12–16 ГБ, Flux.1 [dev] в FP8 — от 16 ГБ, в полной точности и с LoRA-обучением — 24 ГБ. Самый популярный выбор для ComfyUI — RTX 4090: быстрая и с запасом памяти.

Обучение и дообучение

Дообучение LoRA и QLoRA сильно экономит память: QLoRA модели 8B помещается в 16 ГБ, модели до 34B — в 24 ГБ. Полное дообучение и обучение с нуля требуют в 3–4 раза больше памяти, чем инференс, — здесь нужны A100, H100 или H200.

Итог: что арендовать

  • Эксперименты и модели до 8B: RTX 3060 или 4060 Ti 16 ГБ.
  • Stable Diffusion, Flux, модели до 32B: RTX 3090 или 4090.
  • Модели 70B: RTX A6000 или A100.
  • Обучение и быстрый инференс в продакшене: H100 или H200.

Подберите GPU

20 моделей с поминутной оплатой картой РФ.