Как подобрать VPS для локального LLM на CPU
Можно ли запускать модели 7B–13B без видеокарты, сколько нужно RAM и ядер, зачем NVMe и когда всё же брать GPU.
Для кого эта задача
Локальный запуск LLM (через llama.cpp, Ollama и подобные) на CPU-сервере подходит для чат-ботов, RAG и экспериментов, когда важна приватность данных и предсказуемая оплата в рублях.
На CPU реально работают квантованные модели 7B–13B: скорость ниже, чем на GPU, но для многих задач её достаточно.
Минимальные и рекомендуемые ресурсы
Минимум: 4 vCPU, 16 ГБ RAM, 80 ГБ SSD — для моделей 7B в квантовании (Q4/Q5).
Рекомендуется: 8 vCPU, 32 ГБ RAM, 160 ГБ SSD/NVMe — комфортно для 13B и хранения нескольких моделей.
RAM — критичный ресурс: модель целиком загружается в память, и её нехватка просто не даст запуститься.
На что обратить внимание
Объём RAM под модель. Ориентируйтесь на размер весов в выбранном квантовании плюс запас на контекст.
Число и частота ядер. Инференс на CPU хорошо параллелится — больше ядер ускоряют генерацию токенов.
Диск NVMe. Модели весят гигабайты; быстрый диск ускоряет загрузку и подкачку.
Когда нужен GPU. Если важна высокая скорость ответа или модели крупнее 13B — смотрите пресеты с видеокартой.
Что даёт квантование и чем за него платите
Квантование — это хранение весов модели с меньшей точностью: вместо 16 бит на параметр используется 8, 5 или 4. Память при этом сокращается кратно, и именно поэтому модель на 13 миллиардов параметров вообще получается запустить на обычном сервере.
Плата за это — качество ответов. На умеренных уровнях (обычно 5–8 бит) потери малозаметны в прикладных задачах. На агрессивных (4 бита и ниже) модель начинает чаще ошибаться в деталях, хуже держит длинные рассуждения и точные формулировки.
Практическое правило: берите наименее агрессивное квантование, которое помещается в вашу память. Разница между уровнями в гигабайтах невелика, а в качестве — заметна.
Чего ждать от скорости на процессоре
Скорость генерации на процессоре измеряется единицами токенов в секунду против десятков и сотен на видеокарте. Для чата с одним пользователем, ночной обработки документов или пакетных задач этого достаточно. Для интерактивного сервиса с несколькими одновременными пользователями — нет.
На скорость влияют число ядер и, что важнее, пропускная способность оперативной памяти: инференс постоянно перечитывает веса, и память становится узким местом раньше процессора.
Есть и практический нюанс: первый ответ приходит дольше остальных, потому что модель загружается в память. На сервере, который то и дело перезапускается, это ощущается как постоянная задержка — держите сервис запущенным.
Когда переходить на видеокарту
Переходить стоит, когда скорость ответа становится частью продукта: пользователь ждёт в интерфейсе, запросов больше одного одновременно, или вы упёрлись в потолок по размеру модели.
Промежуточный вариант — оставить на процессоре фоновые задачи (индексация документов, пакетная обработка), а интерактивную часть вынести на арендованный GPU-сервер с почасовой оплатой.
Сравнить конфигурации с видеокартой можно в соседнем гайде про инференс на GPU — там разобрано, сколько видеопамяти нужно под разные размеры моделей и чем отличаются доступные карты.
Типичные ошибки
Взять 8 ГБ RAM под модель 13B — она просто не поместится в память.
Ждать от CPU скорости GPU: для интенсивной генерации в реальном времени нужен ускоритель.
Экономить на диске — несколько моделей быстро занимают десятки гигабайт.
Чек-лист перед выбором
- От 4 vCPU (рекомендуется 8)
- От 16 ГБ RAM (рекомендуется 32)
- SSD/NVMe от 80 ГБ под модели
- Модели 7B–13B в квантовании
- Регион RU или EU
- Понимание, когда переходить на GPU
Частые вопросы
Можно ли запускать LLM без видеокарты?
Да, на CPU реально работают квантованные модели 7B–13B через llama.cpp, Ollama и подобные инструменты. Скорость ниже, чем на GPU, но для многих задач её достаточно — особенно когда важны приватность данных и предсказуемая стоимость.
Сколько нужно оперативной памяти для локальной модели?
Для моделей 7B в квантовании Q4/Q5 — минимум 4 vCPU, 16 ГБ RAM и 80 ГБ SSD. Для 13B и хранения нескольких моделей — 8 vCPU, 32 ГБ RAM и 160 ГБ SSD или NVMe. Память здесь критична: модель загружается в неё целиком, и при нехватке просто не запустится.
Когда для LLM всё-таки нужен GPU?
Если важна высокая скорость ответа или вы работаете с моделями крупнее 13B. Ждать от процессора скорости ускорителя не стоит: для интенсивной генерации в реальном времени нужен GPU.