Тераферма Регистрация
GPU для искусственного интеллекта

Аренда видеокарт для ИИ и нейросетей

Для нейросетей на Тераферме доступны видеокарты от 22 ₽ в час: RTX 3090 и 4090 для Stable Diffusion и инференса моделей до 32B, A6000 и L40S с 48 ГБ для 70B в 4 битах, A100, H100 и H200 для обучения. Оплата картой РФ, поминутно.

Серверная видеокарта и нейросеть над ней

Какую GPU выбрать под модель

ВидеокартаПамятьLLM в FP16, доLLM в 4 битах, доОт, ₽/час
RTX 309024 ГБ10 млрд34 млрд22
RTX 409024 ГБ10 млрд34 млрд44
RTX 509032 ГБ13 млрд45 млрд70
RTX A600048 ГБ20 млрд68 млрд60
L40S48 ГБ20 млрд68 млрд102
A10080 ГБ34 млрд113 млрд102
H10080 ГБ34 млрд113 млрд255
H200141 ГБ59 млрд199 млрд534

Оценка с запасом 15% памяти под контекст и служебные буферы. Длинный контекст и большой batch требуют больше.

Инференс LLM

vLLM, Ollama, llama.cpp и TGI. Скорость генерации упирается в пропускную способность памяти: у RTX 4090 — 1 ТБ/с, у H100 — 3,35 ТБ/с.

Генерация изображений

ComfyUI, Automatic1111, Forge. SDXL комфортно работает на 16 ГБ, Flux.1 в полной точности — на 24 ГБ.

Дообучение

LoRA и QLoRA через Unsloth, Axolotl или PEFT. 24 ГБ хватает для QLoRA моделей до 34B.

Обучение с нуля

A100, H100 и H200 с памятью HBM и тензорными ядрами BF16 — для серьёзных экспериментов и больших моделей.

Цены на GPU для нейросетей

ВидеокартаТипПамятьFP16, TFLOPSЦена, ₽/час
RTX 3090 игровая 24 ГБ ≈71 22
RTX 4090 игровая 24 ГБ ≈165 44
RTX 5090 игровая 32 ГБ ≈210 70
RTX A6000 профессиональная 48 ГБ ≈155 60
L40S серверная 48 ГБ ≈362 102
A100 серверная 80 ГБ ≈312 102
H100 серверная 80 ГБ ≈989 255
H200 серверная 141 ГБ ≈989 534

Вопросы об аренде GPU для ИИ

Какая видеокарта нужна для нейросети?

Ориентируйтесь на видеопамять: модель в FP16 занимает около 2 ГБ на миллиард параметров, в 4 битах — около 0,6 ГБ. Для 8B хватит 16–24 ГБ, для 32B — 24 ГБ в 4 битах, для 70B — от 48 ГБ.

Что выгоднее для инференса LLM: RTX 4090 или A100?

RTX 4090 дешевле (от 44 ₽/час) и быстрее на моделях до 24 ГБ. A100 (от 102 ₽/час) нужна, когда модель не помещается в 24 ГБ или нужен большой batch.

Можно ли дообучить модель на арендованной GPU?

Да. LoRA и QLoRA моделей до 13–34B делают на картах с 24–48 ГБ, полное дообучение больших моделей — на A100, H100 и H200.

Есть ли готовые шаблоны для ИИ?

Да: PyTorch с CUDA, vLLM и Ollama для инференса, ComfyUI и Automatic1111 для генерации изображений, Jupyter для экспериментов.

Не знаете, какую карту взять?

Сравните модели по памяти и цене в общем каталоге.