Аренда GPU-сервера для инференса: как выбрать и не переплатить

Инференс — это запуск уже обученной модели, и требования у него другие, чем у обучения. Разбираем, сколько нужно видеопамяти под LLM и генерацию картинок, когда хватит бюджетной карты и почему почасовая оплата подходит не всем.

Чем инференс отличается от обучения

Инференс — это работа уже обученной модели: она принимает запрос и выдаёт ответ. Обучение решает обратную задачу — подбирает веса модели по данным. Разница принципиальная для выбора железа: при обучении в память видеокарты кроме самой модели попадают градиенты, состояния оптимизатора и батчи данных, и суммарно это в разы больше весов. При инференсе в память нужно уложить только веса и контекст текущего запроса.

Практический вывод: сервер под инференс дешевле сервера под обучение той же модели. Там, где для файнтюна нужна карта на 80 ГБ, для запуска той же модели в квантованном виде может хватить 24 ГБ. Поэтому не стоит подбирать конфигурацию по статьям про обучение — вы переплатите.

Сколько нужно видеопамяти

VRAM — главный и почти единственный жёсткий лимит. Если модель не помещается в видеопамять, она либо не запустится, либо начнёт частично считаться на процессоре, и скорость упадёт настолько, что смысл в видеокарте пропадёт.

Ориентир для языковых моделей: в квантовании 4 бита на вес модель занимает примерно половину числа своих параметров в гигабайтах. То есть модель на 7–8 миллиардов параметров — это порядка 4–5 ГБ весов, на 13–14 миллиардов — около 8–9 ГБ, на 30–34 миллиарда — примерно 18–20 ГБ. Сверху нужен запас под контекст: чем длиннее диалог или документ, тем больше памяти уходит на кэш внимания, и на длинном контексте он способен занять столько же, сколько сама модель.

Для генерации изображений требования скромнее по памяти, но чувствительнее к скорости карты: типовые модели укладываются в 8–12 ГБ, а вот время генерации напрямую зависит от производительности чипа.

Отсюда практическое правило: берите карту с запасом хотя бы в полтора раза от размера весов. Упереться в нехватку видеопамяти на длинном запросе неприятнее, чем немного переплатить за объём.

Какая карта нужна под вашу задачу

Карты в аренде делятся на три группы, и выбирать между ними стоит осознанно.

Игровые карты вроде RTX 4090 и RTX 5090 дают лучшее соотношение скорости к цене и несут 24–32 ГБ видеопамяти. Этого достаточно для моделей до 30 миллиардов параметров в квантовании и для любой генерации изображений. Минус — меньше памяти, чем у серверных решений, и отсутствие некоторых корпоративных возможностей.

Серверные карты среднего уровня — A4000, A5000, L4 — рассчитаны на круглосуточную работу и экономичны по энергопотреблению. L4 создавалась именно под инференс. Скорость у них ниже, чем у топовых игровых, но они предсказуемее под долгой нагрузкой.

Старшие серверные карты — A100, L40S и конфигурации с двумя картами — нужны, когда модель не влезает в 24–32 ГБ или когда требуется держать много одновременных запросов. Стоят они кратно дороже, и брать их «на всякий случай» — самая дорогая ошибка в этом списке.

Процессор, память и диск: что важно, а что нет

Обычная оперативная память нужна, чтобы загрузить модель с диска и передать её в видеокарту, а также для работы самого сервиса. Разумный ориентир — не меньше объёма видеопамяти, а лучше вдвое больше: тогда загрузка модели и подготовка запросов не станут узким местом.

Процессор при инференсе на видеокарте не является главным ресурсом, но и слабым его брать не стоит: на нём выполняются токенизация, обработка запросов и вся обвязка веб-сервиса. Четырёх–восьми ядер обычно достаточно.

Диск влияет на одну вещь — скорость загрузки модели при старте. Веса весят гигабайты, и на медленном диске запуск сервиса растягивается. Если вы переключаете модели или держите несколько версий, берите NVMe и место с запасом: несколько моделей быстро занимают сотню гигабайт.

Почасовая оплата: когда выгодна, а когда нет

GPU-серверы часто предлагают с оплатой за час. Это выгодно для экспериментов и разовых задач: подобрали модель, проверили качество, выключили. Платить месяц за карту, которая работала три вечера, смысла нет.

Но у постоянно работающего сервиса ситуация обратная. Если инференс обслуживает продукт и должен быть доступен круглосуточно, помесячный тариф почти всегда дешевле, чем те же часы по почасовой ставке. Посчитайте оба варианта до заказа.

И главное про почасовую оплату: счёт идёт за выделенный сервер, а не за фактические вычисления. Забытая включённой машина расходует бюджет ровно так же, как работающая под нагрузкой.

Что проверить у провайдера до оплаты

Модель карты и объём её памяти. В описании тарифа это указывают не всегда — иногда пишут просто «GPU» или «vGPU». Если модель не названа, спрашивайте поддержку: разница между картами внутри одной ценовой категории бывает двукратной.

Версии драйверов и CUDA. Библиотеки инференса требовательны к версиям, и несовпадение обнаруживается уже после оплаты. Уточните, что именно предустановлено и можно ли обновить самостоятельно.

Выделенная карта или общая. «vGPU» означает, что видеокарта делится между несколькими клиентами, и производительность зависит от соседей. Для экспериментов это приемлемо и дешевле, для продакшена — риск.

Типичные ошибки

Подбирать конфигурацию по требованиям для обучения. Инференсу нужно кратно меньше памяти, и переплата тут исчисляется десятками тысяч рублей в месяц.

Смотреть только на объём видеопамяти, игнорируя скорость карты. Модель поместится, но пользователь будет ждать ответ дольше, чем готов.

Не заложить память под контекст. На коротких тестовых запросах всё работает, а на реальном длинном диалоге сервис падает по нехватке видеопамяти.

Держать почасовой сервер включённым между экспериментами.

Чек-лист перед выбором

  • Посчитайте размер весов модели в выбранном квантовании и добавьте запас в полтора раза
  • Заложите видеопамять под длину контекста, а не только под саму модель
  • Уточните у провайдера конкретную модель карты, а не просто «GPU»
  • Проверьте версии драйверов NVIDIA и CUDA под вашу библиотеку инференса
  • Выясните, выделенная карта в тарифе или общая (vGPU)
  • Сравните почасовую и помесячную стоимость под ваш реальный режим работы
  • Возьмите NVMe и место с запасом, если планируете несколько моделей

Частые вопросы

Сколько видеопамяти нужно для запуска LLM?

Зависит от размера модели и квантования. В 4-битном квантовании модель на 7–8 миллиардов параметров занимает порядка 4–5 ГБ, на 13–14 миллиардов — около 8–9 ГБ, на 30–34 миллиарда — примерно 18–20 ГБ. К этому нужен запас под контекст: на длинных диалогах кэш внимания способен занять столько же, сколько сама модель. Практическое правило — карта с запасом хотя бы в полтора раза от размера весов.

Подойдёт ли RTX 4090 для инференса?

Да, это одна из самых практичных карт для этой задачи: 24 ГБ видеопамяти хватает для моделей до 30 миллиардов параметров в квантовании и для любой генерации изображений, а соотношение скорости к цене лучше, чем у серверных карт среднего уровня. Ограничение — объём памяти: под модели крупнее понадобится A100, L40S или конфигурация из двух карт.

Чем инференс отличается от обучения по требованиям к железу?

При обучении в видеопамять кроме модели попадают градиенты, состояния оптимизатора и батчи данных — суммарно в разы больше весов. При инференсе нужны только веса и контекст текущего запроса. Поэтому сервер под инференс дешевле: там, где для файнтюна требуется карта на 80 ГБ, для запуска той же модели в квантованном виде может хватить 24 ГБ.

Выгоднее почасовая оплата или помесячная?

Для экспериментов и разовых задач — почасовая: проверили модель и выключили. Для сервиса, который должен работать круглосуточно, помесячный тариф почти всегда дешевле, чем те же часы по почасовой ставке. Считайте оба варианта под свой режим работы и помните, что счёт идёт за выделенный сервер, а не за фактические вычисления.

Что такое vGPU и стоит ли его брать?

vGPU означает, что физическая видеокарта делится между несколькими клиентами. Это заметно дешевле, но производительность зависит от нагрузки соседей. Для экспериментов и обучения работе с моделями вариант приемлемый; для продакшен-сервиса, где важно предсказуемое время ответа, лучше выделенная карта.

Провайдеры с подходящими тарифами

Считаем по каталогу: у кого дешевле всего конфигурация, отвечающая требованиям этой задачи. Список обновляется вместе с ценами.

  • VDSina

    GPU 16/16/500 · 16 vCPU · 16 GB RAM · 500 ГБ NVMe · GPU 4 ГБ

    от 10 470/мес

  • REG.RU

    GPU-HP A4000 C8-M32-D128 · 8 vCPU · 32 GB RAM · 128 ГБ NVMe · GPU 16 ГБ (NVIDIA A4000)

    от 27 595/мес

  • FirstVDS

    NVIDIA L4 · 8 vCPU · 16 GB RAM · 150 ГБ NVMe · GPU 24 ГБ (NVIDIA L4)

    от 34 900/мес

Готовы выбрать тариф под эту задачу?

Мы подобрали подходящие тарифы и отсортировали их по цене и выгоде.

Подобрать тарифы →