Как подобрать VPS для локального LLM на CPU

Можно ли запускать модели 7B–13B без видеокарты, сколько нужно RAM и ядер, зачем NVMe и когда всё же брать GPU.

Для кого эта задача

Локальный запуск LLM (через llama.cpp, Ollama и подобные) на CPU-сервере подходит для чат-ботов, RAG и экспериментов, когда важна приватность данных и предсказуемая оплата в рублях.

На CPU реально работают квантованные модели 7B–13B: скорость ниже, чем на GPU, но для многих задач её достаточно.

Минимальные и рекомендуемые ресурсы

Минимум: 4 vCPU, 16 ГБ RAM, 80 ГБ SSD — для моделей 7B в квантовании (Q4/Q5).

Рекомендуется: 8 vCPU, 32 ГБ RAM, 160 ГБ SSD/NVMe — комфортно для 13B и хранения нескольких моделей.

RAM — критичный ресурс: модель целиком загружается в память, и её нехватка просто не даст запуститься.

На что обратить внимание

Объём RAM под модель. Ориентируйтесь на размер весов в выбранном квантовании плюс запас на контекст.

Число и частота ядер. Инференс на CPU хорошо параллелится — больше ядер ускоряют генерацию токенов.

Диск NVMe. Модели весят гигабайты; быстрый диск ускоряет загрузку и подкачку.

Когда нужен GPU. Если важна высокая скорость ответа или модели крупнее 13B — смотрите пресеты с видеокартой.

Что даёт квантование и чем за него платите

Квантование — это хранение весов модели с меньшей точностью: вместо 16 бит на параметр используется 8, 5 или 4. Память при этом сокращается кратно, и именно поэтому модель на 13 миллиардов параметров вообще получается запустить на обычном сервере.

Плата за это — качество ответов. На умеренных уровнях (обычно 5–8 бит) потери малозаметны в прикладных задачах. На агрессивных (4 бита и ниже) модель начинает чаще ошибаться в деталях, хуже держит длинные рассуждения и точные формулировки.

Практическое правило: берите наименее агрессивное квантование, которое помещается в вашу память. Разница между уровнями в гигабайтах невелика, а в качестве — заметна.

Чего ждать от скорости на процессоре

Скорость генерации на процессоре измеряется единицами токенов в секунду против десятков и сотен на видеокарте. Для чата с одним пользователем, ночной обработки документов или пакетных задач этого достаточно. Для интерактивного сервиса с несколькими одновременными пользователями — нет.

На скорость влияют число ядер и, что важнее, пропускная способность оперативной памяти: инференс постоянно перечитывает веса, и память становится узким местом раньше процессора.

Есть и практический нюанс: первый ответ приходит дольше остальных, потому что модель загружается в память. На сервере, который то и дело перезапускается, это ощущается как постоянная задержка — держите сервис запущенным.

Когда переходить на видеокарту

Переходить стоит, когда скорость ответа становится частью продукта: пользователь ждёт в интерфейсе, запросов больше одного одновременно, или вы упёрлись в потолок по размеру модели.

Промежуточный вариант — оставить на процессоре фоновые задачи (индексация документов, пакетная обработка), а интерактивную часть вынести на арендованный GPU-сервер с почасовой оплатой.

Сравнить конфигурации с видеокартой можно в соседнем гайде про инференс на GPU — там разобрано, сколько видеопамяти нужно под разные размеры моделей и чем отличаются доступные карты.

Типичные ошибки

Взять 8 ГБ RAM под модель 13B — она просто не поместится в память.

Ждать от CPU скорости GPU: для интенсивной генерации в реальном времени нужен ускоритель.

Экономить на диске — несколько моделей быстро занимают десятки гигабайт.

Чек-лист перед выбором

  • От 4 vCPU (рекомендуется 8)
  • От 16 ГБ RAM (рекомендуется 32)
  • SSD/NVMe от 80 ГБ под модели
  • Модели 7B–13B в квантовании
  • Регион RU или EU
  • Понимание, когда переходить на GPU

Частые вопросы

Можно ли запускать LLM без видеокарты?

Да, на CPU реально работают квантованные модели 7B–13B через llama.cpp, Ollama и подобные инструменты. Скорость ниже, чем на GPU, но для многих задач её достаточно — особенно когда важны приватность данных и предсказуемая стоимость.

Сколько нужно оперативной памяти для локальной модели?

Для моделей 7B в квантовании Q4/Q5 — минимум 4 vCPU, 16 ГБ RAM и 80 ГБ SSD. Для 13B и хранения нескольких моделей — 8 vCPU, 32 ГБ RAM и 160 ГБ SSD или NVMe. Память здесь критична: модель загружается в неё целиком, и при нехватке просто не запустится.

Когда для LLM всё-таки нужен GPU?

Если важна высокая скорость ответа или вы работаете с моделями крупнее 13B. Ждать от процессора скорости ускорителя не стоит: для интенсивной генерации в реальном времени нужен GPU.

Провайдеры с подходящими тарифами

Считаем по каталогу: у кого дешевле всего конфигурация, отвечающая требованиям этой задачи. Список обновляется вместе с ценами.

  • Selectel

    VDS 8-16-160 · 8 vCPU · 16 GB RAM · 160 ГБ SSD

    от 3 000/мес

  • AdminVPS

    Pro (3,6 ГГц) · 8 vCPU · 16 GB RAM · 160 ГБ NVMe

    от 3 379/мес

  • RuVDS

    Мощный 3 · 4 vCPU · 16 GB RAM · 160 ГБ SSD

    от 3 899/мес

Готовы выбрать тариф под эту задачу?

Мы подобрали подходящие тарифы и отсортировали их по цене и выгоде.

Подобрать тарифы →