3 октября 2026 г. · Редакция Тераферма
Какую видеокарту выбрать для LLM и Stable Diffusion
Главный критерий выбора видеокарты для нейросетей — объём видеопамяти. Языковая модель в FP16 занимает около 2 ГБ на миллиард параметров, в 4-битной квантизации — около 0,6 ГБ. Для моделей до 8B хватит 12–16 ГБ, для 32B — 24 ГБ (RTX 3090/4090), для 70B — 48 ГБ и больше.
Почему память важнее TFLOPS
Чтобы модель работала быстро, все её веса должны лежать в памяти видеокарты. Если не помещаются — часть уходит в оперативную память, и скорость падает в десятки раз. Поэтому RTX 3090 с 24 ГБ для LLM часто полезнее, чем более быстрая RTX 4080 с 16 ГБ.
Вторая по важности характеристика — пропускная способность памяти. При генерации текста карта на каждом токене прочитывает все веса модели, и именно скорость чтения определяет, сколько токенов в секунду вы получите. У RTX 4090 это около 1 ТБ/с, у H100 — 3,35 ТБ/с.
Сколько памяти нужно под популярные модели
| Модель | FP16 | 4 бита | Подойдёт |
|---|---|---|---|
| Llama 3.1 8B, Qwen 2.5 7B | ~16 ГБ | ~5 ГБ | RTX 3060 12 ГБ и выше |
| Qwen 2.5 14B, Phi-4 | ~28 ГБ | ~9 ГБ | RTX 4060 Ti 16 ГБ, RTX 3090 |
| Qwen 2.5 32B, Gemma 2 27B | ~64 ГБ | ~20 ГБ | RTX 3090, 4090, 5090 |
| Llama 3.3 70B, Qwen 2.5 72B | ~140 ГБ | ~42 ГБ | RTX A6000, L40S, A100, H100 |
Без учёта KV-кэша: длинный контекст требует ещё несколько гигабайт.
Какие видеокарты что тянут
| Видеокарта | Память | LLM в 4 битах, до | Аренда от |
|---|---|---|---|
| RTX 3060 | 12 ГБ | 17 млрд | 10 ₽/ч |
| RTX 4060 Ti | 16 ГБ | 22 млрд | 15 ₽/ч |
| RTX 3090 | 24 ГБ | 34 млрд | 22 ₽/ч |
| RTX 4090 | 24 ГБ | 34 млрд | 44 ₽/ч |
| RTX 5090 | 32 ГБ | 45 млрд | 70 ₽/ч |
| RTX A6000 | 48 ГБ | 68 млрд | 60 ₽/ч |
| A100 | 80 ГБ | 113 млрд | 102 ₽/ч |
| H100 | 80 ГБ | 113 млрд | 255 ₽/ч |
| H200 | 141 ГБ | 199 млрд | 534 ₽/ч |
Stable Diffusion, SDXL и Flux
Для генерации изображений память тоже решает, но требования скромнее. Stable Diffusion 1.5 работает на 8 ГБ, SDXL комфортно — на 12–16 ГБ, Flux.1 [dev] в FP8 — от 16 ГБ, в полной точности и с LoRA-обучением — 24 ГБ. Самый популярный выбор для ComfyUI — RTX 4090: быстрая и с запасом памяти.
Обучение и дообучение
Дообучение LoRA и QLoRA сильно экономит память: QLoRA модели 8B помещается в 16 ГБ, модели до 34B — в 24 ГБ. Полное дообучение и обучение с нуля требуют в 3–4 раза больше памяти, чем инференс, — здесь нужны A100, H100 или H200.