Тераферма Регистрация

3 октября 2026 г. · Редакция Тераферма

Сколько видеопамяти нужно для LLM: формула, таблица для 7B–70B и выбор GPU

Схема распределения видеопамяти GPU между весами языковой модели и KV-кэшем

Для запуска LLM нужно примерно столько гигабайт видеопамяти, сколько миллиардов параметров у модели, умноженное на число байт на параметр, плюс 10–20% на контекст и служебные нужды. Модель 8B в 4 битах занимает около 6 ГБ, 32B — около 20 ГБ, 70B — около 42 ГБ. Обучение требует в несколько раз больше, чем инференс.

Ниже формула, таблица для популярных размеров и подбор видеокарты под каждый случай.

Формула: из чего складывается расход памяти

Память при работе языковой модели расходуется на три вещи.

1. Веса модели. Главная статья. Считается так:

память под веса ≈ число параметров × байт на параметр

Сколько байт занимает один параметр, зависит от точности:

  • FP32 — 4 байта (для инференса почти не используется);
  • FP16 и BF16 — 2 байта (стандарт для «полного качества»);
  • INT8 и FP8 — 1 байт;
  • 4-битные форматы (GPTQ, AWQ, GGUF Q4) — около 0,5–0,6 байта с учётом служебных данных квантования.

Пример: Llama 3.1 8B в BF16 — это 8 млрд × 2 байта = 16 ГБ. В 4 битах — около 8 × 0,55 ≈ 4,5 ГБ.

2. KV-кэш. Модель хранит промежуточные данные для каждого токена контекста. Чем длиннее диалог или документ, тем больше памяти. Для современных моделей с групповым вниманием (GQA) ориентиры такие:

  • модель класса 8B: около 128 КБ на токен в FP16, то есть 32 тыс. токенов ≈ 4 ГБ, 128 тыс. ≈ 16 ГБ;
  • модель класса 70B: около 320 КБ на токен, то есть 32 тыс. токенов ≈ 10 ГБ.

Если сервер обслуживает несколько пользователей одновременно, KV-кэш умножается на число параллельных запросов.

3. Служебные расходы. CUDA-контекст, буферы фреймворка, активации. Обычно 0,5–2 ГБ плюс 5–10% от объёма модели.

Итоговая прикидка для инференса:

VRAM ≈ веса + KV-кэш под нужный контекст + 1–2 ГБ запаса

Таблица: сколько видеопамяти нужно для популярных размеров LLM

Значения для инференса с контекстом около 8 тыс. токенов, один пользователь. Для длинного контекста добавляйте KV-кэш по формуле выше.

Размер модели FP16 / BF16 8 бит 4 бита Подходящая карта для 4 бит
3–4B 8–9 ГБ 5 ГБ 3 ГБ RTX 3060 (12 ГБ)
7–8B 17–18 ГБ 9–10 ГБ 6 ГБ RTX 3060 (12 ГБ)
13–14B 29–30 ГБ 16 ГБ 9–10 ГБ RTX 4060 Ti (16 ГБ)
24–27B 50–56 ГБ 27–29 ГБ 15–17 ГБ RTX 3090 / 4090 (24 ГБ)
32B 66 ГБ 35 ГБ 19–21 ГБ RTX 5090 (32 ГБ)
70B 142 ГБ 72–75 ГБ 40–43 ГБ RTX A6000 / L40S (48 ГБ)
100–123B 200–250 ГБ 105–125 ГБ 60–70 ГБ A100 / H100 (80 ГБ)

Несколько выводов из таблицы:

  • 24 ГБ — комфортный минимум для экспериментов: в них помещаются модели до 27B в 4 битах.
  • 32 ГБ RTX 5090 закрывают класс 32B с запасом под длинный контекст. Подробнее — в статье RTX 5090 для ИИ.
  • 48 ГБ — порог для 70B в 4 битах.
  • 80 ГБ нужны для 70B в 8 битах или для моделей крупнее 100B в 4 битах.

Модели со смесью экспертов (MoE) требуют памяти по полному числу параметров, а не по числу активных. Модель с 30B общих и 3B активных параметров займёт память как 30B, хотя считать будет быстро.

Обучение и дообучение: памяти нужно намного больше

При инференсе в памяти лежат только веса и контекст. При обучении к ним добавляются градиенты, состояния оптимизатора и активации для обратного прохода.

Полное дообучение

Ориентир для смешанной точности с оптимизатором Adam — около 16 байт на параметр без учёта активаций:

  • веса в BF16 — 2 байта;
  • градиенты — 2 байта;
  • основная копия весов в FP32 — 4 байта;
  • два состояния Adam — 8 байт.

Для модели 7B это около 112 ГБ плюс активации. Одна A100 на 80 ГБ не справится без специальных техник вроде DeepSpeed ZeRO с выгрузкой в оперативную память. Реалистично — 2–4 карты A100 или H100.

LoRA

Основные веса заморожены, обучаются небольшие адаптеры. Памяти нужно чуть больше, чем для инференса в той же точности. Модель 8B в BF16 с LoRA помещается в 24 ГБ.

QLoRA

Основные веса хранятся в 4 битах, адаптеры обучаются в 16. Самый экономный вариант:

Модель QLoRA, примерная VRAM Подходящая карта Цена, ₽/час
7–8B 10–14 ГБ RTX 4060 Ti, RTX A4000 13–15
13–14B 16–22 ГБ RTX 3090 22
32B 24–30 ГБ RTX 5090 70
70B 42–48 ГБ RTX A6000 60

Расход сильно зависит от длины последовательности и размера батча. Если упираетесь в память, включите gradient checkpointing: обучение замедлится примерно на 20–30%, зато активации займут в разы меньше места.

Как подобрать видеокарту под свою модель

Алгоритм на практике:

  1. Возьмите размер модели и нужную точность, посчитайте веса.
  2. Добавьте KV-кэш под реальную длину контекста.
  3. Добавьте 10–20% запаса.
  4. Выберите самую дешёвую карту, у которой памяти больше получившегося числа.

Пример. Нужно запустить модель 32B в 4 битах с контекстом 32 тыс. токенов для одного пользователя. Веса — около 20 ГБ. KV-кэш для модели такого класса на 32 тыс. токенов — порядка 8 ГБ. Служебные — 1,5 ГБ. Итого около 30 ГБ. RTX 4090 с 24 ГБ не хватит, RTX 5090 с 32 ГБ подходит впритык, а RTX A6000 с 48 ГБ — с запасом и дешевле в час: 60 ₽ против 70 ₽. Но RTX 5090 заметно быстрее генерирует токены благодаря скорости памяти. Выбор зависит от того, что важнее: контекст с запасом или скорость ответа.

Сервер на несколько пользователей

Если модель отвечает не вам одному, а команде или приложению, расчёт меняется. Веса загружаются один раз, а KV-кэш нужен на каждый одновременный запрос.

Пример. Модель 8B в 8 битах (около 9 ГБ весов) обслуживает до 10 одновременных запросов с контекстом по 8 тыс. токенов. KV-кэш: 10 × 8 тыс. × 128 КБ ≈ 10 ГБ. Плюс 2 ГБ служебных. Итого около 21 ГБ, подойдёт RTX 3090 или 4090 с 24 ГБ.

Та же модель с контекстом 32 тыс. токенов на тех же 10 запросах потребует уже около 40 ГБ под кэш. Здесь понадобится RTX A6000 или A100. Современные серверы инференса вроде vLLM выделяют кэш постранично и не резервируют максимум под каждый запрос, поэтому реальный расход обычно ниже теоретического. Но планировать лучше по верхней оценке.

Почему реальный расход отличается от расчётного

Формула даёт порядок величины, а не точное число. На практике расход сдвигается по нескольким причинам:

  • Размер файла модели не равен расходу памяти. Файл GGUF на 4,9 ГБ после загрузки займёт на 1–2 ГБ больше из-за буферов и кэша.
  • Фреймворк резервирует память заранее. vLLM по умолчанию забирает около 90% видеопамяти под кэш, даже если модель маленькая. Это нормально и настраивается параметром.
  • Словарь и эмбеддинги. У моделей с большим словарём (150 тыс. токенов и больше) слои эмбеддингов занимают заметную долю, особенно у небольших моделей.
  • Разные варианты квантования. Q4_K_M, Q5_K_M, AWQ и GPTQ отличаются по размеру на 10–25% при формально одинаковых «4 битах».

Поэтому запас в 10–20% — не перестраховка, а необходимость.

Полный перечень карт с объёмом памяти — на странице аренды GPU для ИИ.

Как уместить модель в меньший объём

Если до нужной карты не хватает пары гигабайт, есть способы ужаться:

  • Квантование сильнее. Переход с 8 на 4 бита сокращает веса почти вдвое. Для больших моделей потеря качества обычно небольшая, для маленьких (до 7B) заметнее.
  • Квантование KV-кэша. Многие серверы инференса умеют хранить кэш в 8 битах. Это вдвое сокращает память под контекст.
  • Короче контекст. Если в задаче не нужны 128 тыс. токенов, ограничьте максимальную длину. Это главная статья экономии.
  • Меньше параллельных запросов. Для сервера инференса число одновременных пользователей напрямую умножает KV-кэш.
  • Выгрузка части слоёв в RAM. llama.cpp и похожие инструменты умеют держать часть слоёв в оперативной памяти. Работать будет, но медленно: скорость падает в разы.

Если ни один способ не помогает, проще взять карту побольше. В аренде это минута: остановили машину на RTX 4090, запустили на RTX A6000.

Сколько это стоит в аренде

Задача Карта Цена, ₽/час
Инференс 8B в 4 битах RTX 3060 10
Инференс 14B в 8 битах RTX 3090 22
Инференс 32B в 4 битах, длинный контекст RTX 5090 70
Инференс 70B в 4 битах RTX A6000 60
Инференс 70B в 8 битах A100 80 ГБ 102
Полное дообучение 7–8B 2–4× A100 или H100 от 204

Оплата на Тераферме поминутная, картой РФ. Протестировать модель 70B в течение двух часов на RTX A6000 стоит около 120 ₽. Сравнить три модели разного размера за вечер — пара сотен рублей.

Если вы ещё не определились с задачей и картой, начните с обзора аренды видеокарты для нейросети. Актуальные цены на все конфигурации — на странице цен.

Итог

Память под LLM считается просто: параметры × байты + контекст + запас. Для инференса в 4 битах ориентир — около 0,6 ГБ на миллиард параметров плюс KV-кэш. Для обучения памяти нужно в разы больше, и здесь выручает QLoRA.

Посчитайте объём под свою модель, выберите карту с запасом в 10–20% и запустите её на Тераферме на нужное время, без покупки железа.

Вопросы по теме

Сколько видеопамяти нужно для модели 7B или 8B?

В 16 битах около 16 ГБ, в 8 битах около 9 ГБ, в 4 битах 5–6 ГБ плюс память под контекст. На практике 8B в 4 битах уверенно работает на картах с 12 ГБ.

Можно ли запустить Llama 70B на одной видеокарте?

В 4-битном квантовании модели 70B нужно около 40–45 ГБ, поэтому подойдёт одна карта с 48 ГБ (RTX A6000, L40S) или A100 с 80 ГБ. В 24 или 32 ГБ она целиком не поместится.

Сколько памяти нужно для дообучения LLM?

Для QLoRA модели 7–8B хватает 12–16 ГБ, для 70B — около 48 ГБ. Полное дообучение требует порядка 16 байт на параметр, то есть свыше 100 ГБ уже для 7B.

Почему модель влезла, но падает на длинном запросе?

Растёт KV-кэш: память под контекст увеличивается пропорционально числу токенов. Для 8B-модели 32 тысячи токенов контекста занимают около 4 ГБ, 128 тысяч — около 16 ГБ.

Что делать, если памяти не хватает?

Квантовать модель сильнее, уменьшить контекст или батч, либо взять карту с большим объёмом. В аренде переход с 24 на 48 ГБ — это смена тарифа, а не покупка нового железа.

Подберите GPU

20 моделей с поминутной оплатой картой РФ.