Аренда GPU-сервера для инференса: как выбрать и не переплатить
Инференс — это запуск уже обученной модели, и требования у него другие, чем у обучения. Разбираем, сколько нужно видеопамяти под LLM и генерацию картинок, когда хватит бюджетной карты и почему почасовая оплата подходит не всем.
Чем инференс отличается от обучения
Инференс — это работа уже обученной модели: она принимает запрос и выдаёт ответ. Обучение решает обратную задачу — подбирает веса модели по данным. Разница принципиальная для выбора железа: при обучении в память видеокарты кроме самой модели попадают градиенты, состояния оптимизатора и батчи данных, и суммарно это в разы больше весов. При инференсе в память нужно уложить только веса и контекст текущего запроса.
Практический вывод: сервер под инференс дешевле сервера под обучение той же модели. Там, где для файнтюна нужна карта на 80 ГБ, для запуска той же модели в квантованном виде может хватить 24 ГБ. Поэтому не стоит подбирать конфигурацию по статьям про обучение — вы переплатите.
Сколько нужно видеопамяти
VRAM — главный и почти единственный жёсткий лимит. Если модель не помещается в видеопамять, она либо не запустится, либо начнёт частично считаться на процессоре, и скорость упадёт настолько, что смысл в видеокарте пропадёт.
Ориентир для языковых моделей: в квантовании 4 бита на вес модель занимает примерно половину числа своих параметров в гигабайтах. То есть модель на 7–8 миллиардов параметров — это порядка 4–5 ГБ весов, на 13–14 миллиардов — около 8–9 ГБ, на 30–34 миллиарда — примерно 18–20 ГБ. Сверху нужен запас под контекст: чем длиннее диалог или документ, тем больше памяти уходит на кэш внимания, и на длинном контексте он способен занять столько же, сколько сама модель.
Для генерации изображений требования скромнее по памяти, но чувствительнее к скорости карты: типовые модели укладываются в 8–12 ГБ, а вот время генерации напрямую зависит от производительности чипа.
Отсюда практическое правило: берите карту с запасом хотя бы в полтора раза от размера весов. Упереться в нехватку видеопамяти на длинном запросе неприятнее, чем немного переплатить за объём.
Какая карта нужна под вашу задачу
Карты в аренде делятся на три группы, и выбирать между ними стоит осознанно.
Игровые карты вроде RTX 4090 и RTX 5090 дают лучшее соотношение скорости к цене и несут 24–32 ГБ видеопамяти. Этого достаточно для моделей до 30 миллиардов параметров в квантовании и для любой генерации изображений. Минус — меньше памяти, чем у серверных решений, и отсутствие некоторых корпоративных возможностей.
Серверные карты среднего уровня — A4000, A5000, L4 — рассчитаны на круглосуточную работу и экономичны по энергопотреблению. L4 создавалась именно под инференс. Скорость у них ниже, чем у топовых игровых, но они предсказуемее под долгой нагрузкой.
Старшие серверные карты — A100, L40S и конфигурации с двумя картами — нужны, когда модель не влезает в 24–32 ГБ или когда требуется держать много одновременных запросов. Стоят они кратно дороже, и брать их «на всякий случай» — самая дорогая ошибка в этом списке.
Процессор, память и диск: что важно, а что нет
Обычная оперативная память нужна, чтобы загрузить модель с диска и передать её в видеокарту, а также для работы самого сервиса. Разумный ориентир — не меньше объёма видеопамяти, а лучше вдвое больше: тогда загрузка модели и подготовка запросов не станут узким местом.
Процессор при инференсе на видеокарте не является главным ресурсом, но и слабым его брать не стоит: на нём выполняются токенизация, обработка запросов и вся обвязка веб-сервиса. Четырёх–восьми ядер обычно достаточно.
Диск влияет на одну вещь — скорость загрузки модели при старте. Веса весят гигабайты, и на медленном диске запуск сервиса растягивается. Если вы переключаете модели или держите несколько версий, берите NVMe и место с запасом: несколько моделей быстро занимают сотню гигабайт.
Почасовая оплата: когда выгодна, а когда нет
GPU-серверы часто предлагают с оплатой за час. Это выгодно для экспериментов и разовых задач: подобрали модель, проверили качество, выключили. Платить месяц за карту, которая работала три вечера, смысла нет.
Но у постоянно работающего сервиса ситуация обратная. Если инференс обслуживает продукт и должен быть доступен круглосуточно, помесячный тариф почти всегда дешевле, чем те же часы по почасовой ставке. Посчитайте оба варианта до заказа.
И главное про почасовую оплату: счёт идёт за выделенный сервер, а не за фактические вычисления. Забытая включённой машина расходует бюджет ровно так же, как работающая под нагрузкой.
Что проверить у провайдера до оплаты
Модель карты и объём её памяти. В описании тарифа это указывают не всегда — иногда пишут просто «GPU» или «vGPU». Если модель не названа, спрашивайте поддержку: разница между картами внутри одной ценовой категории бывает двукратной.
Версии драйверов и CUDA. Библиотеки инференса требовательны к версиям, и несовпадение обнаруживается уже после оплаты. Уточните, что именно предустановлено и можно ли обновить самостоятельно.
Выделенная карта или общая. «vGPU» означает, что видеокарта делится между несколькими клиентами, и производительность зависит от соседей. Для экспериментов это приемлемо и дешевле, для продакшена — риск.
Типичные ошибки
Подбирать конфигурацию по требованиям для обучения. Инференсу нужно кратно меньше памяти, и переплата тут исчисляется десятками тысяч рублей в месяц.
Смотреть только на объём видеопамяти, игнорируя скорость карты. Модель поместится, но пользователь будет ждать ответ дольше, чем готов.
Не заложить память под контекст. На коротких тестовых запросах всё работает, а на реальном длинном диалоге сервис падает по нехватке видеопамяти.
Держать почасовой сервер включённым между экспериментами.
Чек-лист перед выбором
- Посчитайте размер весов модели в выбранном квантовании и добавьте запас в полтора раза
- Заложите видеопамять под длину контекста, а не только под саму модель
- Уточните у провайдера конкретную модель карты, а не просто «GPU»
- Проверьте версии драйверов NVIDIA и CUDA под вашу библиотеку инференса
- Выясните, выделенная карта в тарифе или общая (vGPU)
- Сравните почасовую и помесячную стоимость под ваш реальный режим работы
- Возьмите NVMe и место с запасом, если планируете несколько моделей
Частые вопросы
Сколько видеопамяти нужно для запуска LLM?
Зависит от размера модели и квантования. В 4-битном квантовании модель на 7–8 миллиардов параметров занимает порядка 4–5 ГБ, на 13–14 миллиардов — около 8–9 ГБ, на 30–34 миллиарда — примерно 18–20 ГБ. К этому нужен запас под контекст: на длинных диалогах кэш внимания способен занять столько же, сколько сама модель. Практическое правило — карта с запасом хотя бы в полтора раза от размера весов.
Подойдёт ли RTX 4090 для инференса?
Да, это одна из самых практичных карт для этой задачи: 24 ГБ видеопамяти хватает для моделей до 30 миллиардов параметров в квантовании и для любой генерации изображений, а соотношение скорости к цене лучше, чем у серверных карт среднего уровня. Ограничение — объём памяти: под модели крупнее понадобится A100, L40S или конфигурация из двух карт.
Чем инференс отличается от обучения по требованиям к железу?
При обучении в видеопамять кроме модели попадают градиенты, состояния оптимизатора и батчи данных — суммарно в разы больше весов. При инференсе нужны только веса и контекст текущего запроса. Поэтому сервер под инференс дешевле: там, где для файнтюна требуется карта на 80 ГБ, для запуска той же модели в квантованном виде может хватить 24 ГБ.
Выгоднее почасовая оплата или помесячная?
Для экспериментов и разовых задач — почасовая: проверили модель и выключили. Для сервиса, который должен работать круглосуточно, помесячный тариф почти всегда дешевле, чем те же часы по почасовой ставке. Считайте оба варианта под свой режим работы и помните, что счёт идёт за выделенный сервер, а не за фактические вычисления.
Что такое vGPU и стоит ли его брать?
vGPU означает, что физическая видеокарта делится между несколькими клиентами. Это заметно дешевле, но производительность зависит от нагрузки соседей. Для экспериментов и обучения работе с моделями вариант приемлемый; для продакшен-сервиса, где важно предсказуемое время ответа, лучше выделенная карта.