Как подобрать GPU-сервер для обучения моделей
Зачем для обучения нужна видеокарта, сколько VRAM и RAM закладывать, почему важен NVMe и как не переплатить за простой GPU.
Для кого эта задача
Обучение и файнтюн нейросетей (PyTorch, TensorFlow, CUDA) требуют GPU: на CPU это в десятки раз медленнее. Аренда GPU-сервера избавляет от покупки дорогой карты.
Гайд — про серверы для тренировки и дообучения моделей, а не только инференса.
Минимальные и рекомендуемые ресурсы
Ключевой параметр — VRAM видеокарты: от неё зависит, какого размера модель и батч вы сможете обучать.
Минимум: 8 vCPU, 16 ГБ RAM, 100 ГБ SSD плюс GPU. Рекомендуется: 16 vCPU, 32 ГБ RAM, 250 ГБ NVMe.
Системная RAM должна быть сопоставима или больше VRAM — данные и батчи готовятся на CPU перед отправкой на GPU.
На что обратить внимание
Модель и объём VRAM карты. Проверяйте, какая GPU в тарифе и сколько на ней памяти — это определяет потолок задач.
NVMe под датасеты. Обучение упирается в скорость чтения данных; медленный диск оставит GPU простаивать.
Поддержка CUDA/драйверов. Убедитесь, что провайдер даёт нужные драйверы NVIDIA и версию CUDA.
Почасовая оплата. Для разовых экспериментов выгоднее тарифы с оплатой за час — не платить за простой GPU.
Как посчитать нужный объём видеопамяти
При обучении в память видеокарты попадает не только модель. Кроме самих весов там лежат градиенты, состояния оптимизатора и активации текущего батча — в сумме это кратно больше, чем занимает модель при простом запуске. Для распространённого оптимизатора Adam накладные расходы на состояния сопоставимы с несколькими копиями весов.
Практический ориентир: если модель при инференсе занимает X гигабайт, для полного дообучения закладывайте кратный запас, а не X плюс немного. Именно поэтому файнтюн модели, которая спокойно работает на карте с 24 ГБ, может не запуститься на ней же.
Уменьшить требования помогают методы экономного дообучения — LoRA и подобные, где обновляется малая часть параметров. Они позволяют работать с крупными моделями на картах среднего уровня, и для большинства прикладных задач этого достаточно.
Одна карта или несколько
Конфигурации с двумя картами дают больше суммарной видеопамяти, но это не то же самое, что одна карта удвоенного объёма: модель придётся распределять между устройствами, а это отдельная работа и потери на обмене данными.
Если задача помещается в одну карту — берите одну. Несколько карт оправданы, когда модель не влезает целиком либо когда нужно параллельно гонять независимые эксперименты.
При выборе смотрите не только на объём, но и на пропускную способность памяти: у серверных карт она выше, и на обучении это чувствуется сильнее, чем разница в частоте.
Сколько это стоит на практике
GPU-серверы — самая дорогая позиция каталога: разброс от нескольких тысяч рублей в месяц за vGPU до сотен тысяч за конфигурации с A100. Разница между соседними ступенями измеряется десятками тысяч, поэтому ошибка в подборе обходится дорого.
Перед арендой стоит оценить, сколько часов в месяц карта реально будет под нагрузкой. Обучение редко идёт непрерывно: между запусками данные готовят, результаты разбирают, код правят. Если карта нужна несколько дней в месяц — почасовая оплата дешевле помесячной в разы.
И проверьте, что вы платите за выделенную карту, а не за долю чужой. vGPU дешевле, но производительность зависит от соседей — для обучения с предсказуемым временем это плохой вариант.
Типичные ошибки
Смотреть только на число vCPU и RAM, игнорируя модель и объём VRAM видеокарты — именно она узкое место.
Ставить датасеты на медленный диск — дорогой GPU будет простаивать в ожидании данных.
Держать GPU-сервер включённым между экспериментами при почасовой оплате.
Чек-лист перед выбором
- GPU с достаточным объёмом VRAM под задачу
- От 8 vCPU (рекомендуется 16)
- От 16 ГБ RAM (рекомендуется 32)
- NVMe от 100 ГБ под датасеты
- Поддержка CUDA и драйверов NVIDIA
- Почасовая оплата для разовых задач
Частые вопросы
Какая видеокарта нужна для обучения нейросети?
Смотреть надо в первую очередь на объём видеопамяти: именно VRAM определяет, какого размера модель и батч вы сможете обучать. Проверяйте, какая карта стоит в тарифе и сколько на ней памяти, — число vCPU и объём обычной RAM здесь вторичны.
Сколько нужно CPU и RAM для GPU-сервера?
Минимум — 8 vCPU, 16 ГБ RAM и 100 ГБ SSD плюс сама видеокарта, рекомендуется 16 vCPU, 32 ГБ RAM и 250 ГБ NVMe. Системная память должна быть сопоставима с объёмом видеопамяти или больше: данные и батчи готовятся на процессоре перед отправкой на GPU.
Выгоднее почасовая оплата или помесячная?
Для разовых экспериментов выгоднее почасовые тарифы — вы не платите за простой дорогой карты. Но тогда не забывайте выключать сервер между экспериментами, иначе экономия исчезает.
Почему GPU простаивает во время обучения?
Частая причина — медленный диск: обучение упирается в скорость чтения датасета, и видеокарта ждёт данные. Держите датасеты на NVMe. Ещё проверьте, что провайдер даёт нужные драйверы NVIDIA и версию CUDA.