Как подобрать GPU-сервер для обучения моделей

Зачем для обучения нужна видеокарта, сколько VRAM и RAM закладывать, почему важен NVMe и как не переплатить за простой GPU.

Для кого эта задача

Обучение и файнтюн нейросетей (PyTorch, TensorFlow, CUDA) требуют GPU: на CPU это в десятки раз медленнее. Аренда GPU-сервера избавляет от покупки дорогой карты.

Гайд — про серверы для тренировки и дообучения моделей, а не только инференса.

Минимальные и рекомендуемые ресурсы

Ключевой параметр — VRAM видеокарты: от неё зависит, какого размера модель и батч вы сможете обучать.

Минимум: 8 vCPU, 16 ГБ RAM, 100 ГБ SSD плюс GPU. Рекомендуется: 16 vCPU, 32 ГБ RAM, 250 ГБ NVMe.

Системная RAM должна быть сопоставима или больше VRAM — данные и батчи готовятся на CPU перед отправкой на GPU.

На что обратить внимание

Модель и объём VRAM карты. Проверяйте, какая GPU в тарифе и сколько на ней памяти — это определяет потолок задач.

NVMe под датасеты. Обучение упирается в скорость чтения данных; медленный диск оставит GPU простаивать.

Поддержка CUDA/драйверов. Убедитесь, что провайдер даёт нужные драйверы NVIDIA и версию CUDA.

Почасовая оплата. Для разовых экспериментов выгоднее тарифы с оплатой за час — не платить за простой GPU.

Как посчитать нужный объём видеопамяти

При обучении в память видеокарты попадает не только модель. Кроме самих весов там лежат градиенты, состояния оптимизатора и активации текущего батча — в сумме это кратно больше, чем занимает модель при простом запуске. Для распространённого оптимизатора Adam накладные расходы на состояния сопоставимы с несколькими копиями весов.

Практический ориентир: если модель при инференсе занимает X гигабайт, для полного дообучения закладывайте кратный запас, а не X плюс немного. Именно поэтому файнтюн модели, которая спокойно работает на карте с 24 ГБ, может не запуститься на ней же.

Уменьшить требования помогают методы экономного дообучения — LoRA и подобные, где обновляется малая часть параметров. Они позволяют работать с крупными моделями на картах среднего уровня, и для большинства прикладных задач этого достаточно.

Одна карта или несколько

Конфигурации с двумя картами дают больше суммарной видеопамяти, но это не то же самое, что одна карта удвоенного объёма: модель придётся распределять между устройствами, а это отдельная работа и потери на обмене данными.

Если задача помещается в одну карту — берите одну. Несколько карт оправданы, когда модель не влезает целиком либо когда нужно параллельно гонять независимые эксперименты.

При выборе смотрите не только на объём, но и на пропускную способность памяти: у серверных карт она выше, и на обучении это чувствуется сильнее, чем разница в частоте.

Сколько это стоит на практике

GPU-серверы — самая дорогая позиция каталога: разброс от нескольких тысяч рублей в месяц за vGPU до сотен тысяч за конфигурации с A100. Разница между соседними ступенями измеряется десятками тысяч, поэтому ошибка в подборе обходится дорого.

Перед арендой стоит оценить, сколько часов в месяц карта реально будет под нагрузкой. Обучение редко идёт непрерывно: между запусками данные готовят, результаты разбирают, код правят. Если карта нужна несколько дней в месяц — почасовая оплата дешевле помесячной в разы.

И проверьте, что вы платите за выделенную карту, а не за долю чужой. vGPU дешевле, но производительность зависит от соседей — для обучения с предсказуемым временем это плохой вариант.

Типичные ошибки

Смотреть только на число vCPU и RAM, игнорируя модель и объём VRAM видеокарты — именно она узкое место.

Ставить датасеты на медленный диск — дорогой GPU будет простаивать в ожидании данных.

Держать GPU-сервер включённым между экспериментами при почасовой оплате.

Чек-лист перед выбором

  • GPU с достаточным объёмом VRAM под задачу
  • От 8 vCPU (рекомендуется 16)
  • От 16 ГБ RAM (рекомендуется 32)
  • NVMe от 100 ГБ под датасеты
  • Поддержка CUDA и драйверов NVIDIA
  • Почасовая оплата для разовых задач

Частые вопросы

Какая видеокарта нужна для обучения нейросети?

Смотреть надо в первую очередь на объём видеопамяти: именно VRAM определяет, какого размера модель и батч вы сможете обучать. Проверяйте, какая карта стоит в тарифе и сколько на ней памяти, — число vCPU и объём обычной RAM здесь вторичны.

Сколько нужно CPU и RAM для GPU-сервера?

Минимум — 8 vCPU, 16 ГБ RAM и 100 ГБ SSD плюс сама видеокарта, рекомендуется 16 vCPU, 32 ГБ RAM и 250 ГБ NVMe. Системная память должна быть сопоставима с объёмом видеопамяти или больше: данные и батчи готовятся на процессоре перед отправкой на GPU.

Выгоднее почасовая оплата или помесячная?

Для разовых экспериментов выгоднее почасовые тарифы — вы не платите за простой дорогой карты. Но тогда не забывайте выключать сервер между экспериментами, иначе экономия исчезает.

Почему GPU простаивает во время обучения?

Частая причина — медленный диск: обучение упирается в скорость чтения датасета, и видеокарта ждёт данные. Держите датасеты на NVMe. Ещё проверьте, что провайдер даёт нужные драйверы NVIDIA и версию CUDA.

Провайдеры с подходящими тарифами

Считаем по каталогу: у кого дешевле всего конфигурация, отвечающая требованиям этой задачи. Список обновляется вместе с ценами.

  • VDSina

    GPU 16/16/500 · 16 vCPU · 16 GB RAM · 500 ГБ NVMe · GPU 4 ГБ

    от 10 470/мес

  • FirstVDS

    NVIDIA L4 · 8 vCPU · 16 GB RAM · 150 ГБ NVMe · GPU 24 ГБ (NVIDIA L4)

    от 34 900/мес

  • immers.cloud

    RTX 3090 · 1 GPU · 8 vCPU · 16 GB RAM · 160 ГБ NVMe · GPU 24 ГБ (RTX 3090)

    от 48 910/мес

Готовы выбрать тариф под эту задачу?

Мы подобрали подходящие тарифы и отсортировали их по цене и выгоде.

Подобрать тарифы →