3 октября 2026 г. · Редакция Тераферма
Сколько видеопамяти нужно для LLM: формула, таблица для 7B–70B и выбор GPU
Для запуска LLM нужно примерно столько гигабайт видеопамяти, сколько миллиардов параметров у модели, умноженное на число байт на параметр, плюс 10–20% на контекст и служебные нужды. Модель 8B в 4 битах занимает около 6 ГБ, 32B — около 20 ГБ, 70B — около 42 ГБ. Обучение требует в несколько раз больше, чем инференс.
Ниже формула, таблица для популярных размеров и подбор видеокарты под каждый случай.
Формула: из чего складывается расход памяти
Память при работе языковой модели расходуется на три вещи.
1. Веса модели. Главная статья. Считается так:
память под веса ≈ число параметров × байт на параметр
Сколько байт занимает один параметр, зависит от точности:
- FP32 — 4 байта (для инференса почти не используется);
- FP16 и BF16 — 2 байта (стандарт для «полного качества»);
- INT8 и FP8 — 1 байт;
- 4-битные форматы (GPTQ, AWQ, GGUF Q4) — около 0,5–0,6 байта с учётом служебных данных квантования.
Пример: Llama 3.1 8B в BF16 — это 8 млрд × 2 байта = 16 ГБ. В 4 битах — около 8 × 0,55 ≈ 4,5 ГБ.
2. KV-кэш. Модель хранит промежуточные данные для каждого токена контекста. Чем длиннее диалог или документ, тем больше памяти. Для современных моделей с групповым вниманием (GQA) ориентиры такие:
- модель класса 8B: около 128 КБ на токен в FP16, то есть 32 тыс. токенов ≈ 4 ГБ, 128 тыс. ≈ 16 ГБ;
- модель класса 70B: около 320 КБ на токен, то есть 32 тыс. токенов ≈ 10 ГБ.
Если сервер обслуживает несколько пользователей одновременно, KV-кэш умножается на число параллельных запросов.
3. Служебные расходы. CUDA-контекст, буферы фреймворка, активации. Обычно 0,5–2 ГБ плюс 5–10% от объёма модели.
Итоговая прикидка для инференса:
VRAM ≈ веса + KV-кэш под нужный контекст + 1–2 ГБ запаса
Таблица: сколько видеопамяти нужно для популярных размеров LLM
Значения для инференса с контекстом около 8 тыс. токенов, один пользователь. Для длинного контекста добавляйте KV-кэш по формуле выше.
| Размер модели | FP16 / BF16 | 8 бит | 4 бита | Подходящая карта для 4 бит |
|---|---|---|---|---|
| 3–4B | 8–9 ГБ | 5 ГБ | 3 ГБ | RTX 3060 (12 ГБ) |
| 7–8B | 17–18 ГБ | 9–10 ГБ | 6 ГБ | RTX 3060 (12 ГБ) |
| 13–14B | 29–30 ГБ | 16 ГБ | 9–10 ГБ | RTX 4060 Ti (16 ГБ) |
| 24–27B | 50–56 ГБ | 27–29 ГБ | 15–17 ГБ | RTX 3090 / 4090 (24 ГБ) |
| 32B | 66 ГБ | 35 ГБ | 19–21 ГБ | RTX 5090 (32 ГБ) |
| 70B | 142 ГБ | 72–75 ГБ | 40–43 ГБ | RTX A6000 / L40S (48 ГБ) |
| 100–123B | 200–250 ГБ | 105–125 ГБ | 60–70 ГБ | A100 / H100 (80 ГБ) |
Несколько выводов из таблицы:
- 24 ГБ — комфортный минимум для экспериментов: в них помещаются модели до 27B в 4 битах.
- 32 ГБ RTX 5090 закрывают класс 32B с запасом под длинный контекст. Подробнее — в статье RTX 5090 для ИИ.
- 48 ГБ — порог для 70B в 4 битах.
- 80 ГБ нужны для 70B в 8 битах или для моделей крупнее 100B в 4 битах.
Модели со смесью экспертов (MoE) требуют памяти по полному числу параметров, а не по числу активных. Модель с 30B общих и 3B активных параметров займёт память как 30B, хотя считать будет быстро.
Обучение и дообучение: памяти нужно намного больше
При инференсе в памяти лежат только веса и контекст. При обучении к ним добавляются градиенты, состояния оптимизатора и активации для обратного прохода.
Полное дообучение
Ориентир для смешанной точности с оптимизатором Adam — около 16 байт на параметр без учёта активаций:
- веса в BF16 — 2 байта;
- градиенты — 2 байта;
- основная копия весов в FP32 — 4 байта;
- два состояния Adam — 8 байт.
Для модели 7B это около 112 ГБ плюс активации. Одна A100 на 80 ГБ не справится без специальных техник вроде DeepSpeed ZeRO с выгрузкой в оперативную память. Реалистично — 2–4 карты A100 или H100.
LoRA
Основные веса заморожены, обучаются небольшие адаптеры. Памяти нужно чуть больше, чем для инференса в той же точности. Модель 8B в BF16 с LoRA помещается в 24 ГБ.
QLoRA
Основные веса хранятся в 4 битах, адаптеры обучаются в 16. Самый экономный вариант:
| Модель | QLoRA, примерная VRAM | Подходящая карта | Цена, ₽/час |
|---|---|---|---|
| 7–8B | 10–14 ГБ | RTX 4060 Ti, RTX A4000 | 13–15 |
| 13–14B | 16–22 ГБ | RTX 3090 | 22 |
| 32B | 24–30 ГБ | RTX 5090 | 70 |
| 70B | 42–48 ГБ | RTX A6000 | 60 |
Расход сильно зависит от длины последовательности и размера батча. Если упираетесь в память, включите gradient checkpointing: обучение замедлится примерно на 20–30%, зато активации займут в разы меньше места.
Как подобрать видеокарту под свою модель
Алгоритм на практике:
- Возьмите размер модели и нужную точность, посчитайте веса.
- Добавьте KV-кэш под реальную длину контекста.
- Добавьте 10–20% запаса.
- Выберите самую дешёвую карту, у которой памяти больше получившегося числа.
Пример. Нужно запустить модель 32B в 4 битах с контекстом 32 тыс. токенов для одного пользователя. Веса — около 20 ГБ. KV-кэш для модели такого класса на 32 тыс. токенов — порядка 8 ГБ. Служебные — 1,5 ГБ. Итого около 30 ГБ. RTX 4090 с 24 ГБ не хватит, RTX 5090 с 32 ГБ подходит впритык, а RTX A6000 с 48 ГБ — с запасом и дешевле в час: 60 ₽ против 70 ₽. Но RTX 5090 заметно быстрее генерирует токены благодаря скорости памяти. Выбор зависит от того, что важнее: контекст с запасом или скорость ответа.
Сервер на несколько пользователей
Если модель отвечает не вам одному, а команде или приложению, расчёт меняется. Веса загружаются один раз, а KV-кэш нужен на каждый одновременный запрос.
Пример. Модель 8B в 8 битах (около 9 ГБ весов) обслуживает до 10 одновременных запросов с контекстом по 8 тыс. токенов. KV-кэш: 10 × 8 тыс. × 128 КБ ≈ 10 ГБ. Плюс 2 ГБ служебных. Итого около 21 ГБ, подойдёт RTX 3090 или 4090 с 24 ГБ.
Та же модель с контекстом 32 тыс. токенов на тех же 10 запросах потребует уже около 40 ГБ под кэш. Здесь понадобится RTX A6000 или A100. Современные серверы инференса вроде vLLM выделяют кэш постранично и не резервируют максимум под каждый запрос, поэтому реальный расход обычно ниже теоретического. Но планировать лучше по верхней оценке.
Почему реальный расход отличается от расчётного
Формула даёт порядок величины, а не точное число. На практике расход сдвигается по нескольким причинам:
- Размер файла модели не равен расходу памяти. Файл GGUF на 4,9 ГБ после загрузки займёт на 1–2 ГБ больше из-за буферов и кэша.
- Фреймворк резервирует память заранее. vLLM по умолчанию забирает около 90% видеопамяти под кэш, даже если модель маленькая. Это нормально и настраивается параметром.
- Словарь и эмбеддинги. У моделей с большим словарём (150 тыс. токенов и больше) слои эмбеддингов занимают заметную долю, особенно у небольших моделей.
- Разные варианты квантования. Q4_K_M, Q5_K_M, AWQ и GPTQ отличаются по размеру на 10–25% при формально одинаковых «4 битах».
Поэтому запас в 10–20% — не перестраховка, а необходимость.
Полный перечень карт с объёмом памяти — на странице аренды GPU для ИИ.
Как уместить модель в меньший объём
Если до нужной карты не хватает пары гигабайт, есть способы ужаться:
- Квантование сильнее. Переход с 8 на 4 бита сокращает веса почти вдвое. Для больших моделей потеря качества обычно небольшая, для маленьких (до 7B) заметнее.
- Квантование KV-кэша. Многие серверы инференса умеют хранить кэш в 8 битах. Это вдвое сокращает память под контекст.
- Короче контекст. Если в задаче не нужны 128 тыс. токенов, ограничьте максимальную длину. Это главная статья экономии.
- Меньше параллельных запросов. Для сервера инференса число одновременных пользователей напрямую умножает KV-кэш.
- Выгрузка части слоёв в RAM. llama.cpp и похожие инструменты умеют держать часть слоёв в оперативной памяти. Работать будет, но медленно: скорость падает в разы.
Если ни один способ не помогает, проще взять карту побольше. В аренде это минута: остановили машину на RTX 4090, запустили на RTX A6000.
Сколько это стоит в аренде
| Задача | Карта | Цена, ₽/час |
|---|---|---|
| Инференс 8B в 4 битах | RTX 3060 | 10 |
| Инференс 14B в 8 битах | RTX 3090 | 22 |
| Инференс 32B в 4 битах, длинный контекст | RTX 5090 | 70 |
| Инференс 70B в 4 битах | RTX A6000 | 60 |
| Инференс 70B в 8 битах | A100 80 ГБ | 102 |
| Полное дообучение 7–8B | 2–4× A100 или H100 | от 204 |
Оплата на Тераферме поминутная, картой РФ. Протестировать модель 70B в течение двух часов на RTX A6000 стоит около 120 ₽. Сравнить три модели разного размера за вечер — пара сотен рублей.
Если вы ещё не определились с задачей и картой, начните с обзора аренды видеокарты для нейросети. Актуальные цены на все конфигурации — на странице цен.
Итог
Память под LLM считается просто: параметры × байты + контекст + запас. Для инференса в 4 битах ориентир — около 0,6 ГБ на миллиард параметров плюс KV-кэш. Для обучения памяти нужно в разы больше, и здесь выручает QLoRA.
Посчитайте объём под свою модель, выберите карту с запасом в 10–20% и запустите её на Тераферме на нужное время, без покупки железа.