- Как работает локальная модель и от чего зависит скорость
- Можно ли ставить локальные ИИ-модели на обычный VPS с Ryzen
- Какой скорости ждать
- Что разумно делать на CPU-VPS
- Быстрый старт на VPS
- Серверы с GPU для серьёзных задач
- Аренда GPU по часам
- Приватные варианты с оплатой криптовалютой
- Мини-ПК для локальных моделей дома
- Что считать комфортной работой
- Мини-ПК, которые уже подходят для вайбкодинга и картинок
- Мини-ПК с внешней видеокартой через OCuLink
- AMD Ryzen AI Max+ 395 (Strix Halo) — всё в одном корпусе
- Mac mini на M5 Pro
- Компактные ПК со встроенной RTX
- NVIDIA DGX Spark
- Средний уровень: мини-ПК на Ryzen 7 и Ryzen AI 9 с 32 ГБ
- Экономный уровень: до 35–40 тыс. ₽
- Чего избегать
- Что выбрать
- Локальные модели для генерации изображений
- Интерфейсы
- Локальные модели для генерации видео
- Модели для вайбкодинга
- Связка: движок плюс редактор
- Сводная таблица: задача → модель → минимум железа
- Типичные ошибки
- С чего начать сегодня
- Полезные ссылки
- Частые вопросы
- Читайте также
Локальные ИИ-модели — это нейросети, которые работают на вашем компьютере или сервере, а не в чужом облаке. Переписка, код и фотографии никуда не уходят, подписка не нужна, а модель продолжает работать даже без интернета. Платить приходится железом: чем умнее модель, тем больше ей нужно памяти.
Ниже — честный разбор без рекламных обещаний: что реально запустить на обычном VPS с Ryzen, когда без видеокарты не обойтись, какой мини-ПК взять домой и какие модели сейчас актуальны для чата, картинок, видео и вайбкодинга. Версии моделей и цены проверены на осень 2026 года. В конце — сводная таблица «задача → модель → минимум железа».
Как работает локальная модель и от чего зависит скорость
Модель — это большой файл с весами. Вы скачиваете его (чаще всего с Hugging Face) и запускаете через программу-«движок»: Ollama, LM Studio или llama.cpp. Все три умеют отдавать OpenAI-совместимый API, так что к ним подключаются чат-интерфейсы, боты и редакторы кода.
- Объём памяти решает, запустится ли модель. При квантовании Q4 (сжатие весов до ~4 бит) грубая оценка — около 0,6 ГБ на миллиард параметров плюс 1–4 ГБ на контекст. Модель на 8B займёт 5–6 ГБ, на 30B — 18–20 ГБ, на 120B — около 65 ГБ.
- Пропускная способность памяти решает скорость. Для каждого нового слова (токена) нужно «прочитать» активные веса. Поэтому видеокарта с памятью 900+ ГБ/с отвечает в разы быстрее, чем процессор с обычной DDR5.
- MoE-модели быстрее, чем кажется по размеру. В архитектуре Mixture of Experts на каждый токен работает лишь часть весов: у Qwen3-Coder 30B активны около 3B, у gpt-oss-120b — около 5B. Памяти нужно на всю модель, а скорость как у маленькой.
- Картинки и видео — другая история. Диффузионные модели упираются не только в память, но и в вычисления. Здесь нужна видеокарта, лучше NVIDIA: большинство инструкций и оптимизаций пишут под CUDA.
Можно ли ставить локальные ИИ-модели на обычный VPS с Ryzen
Можно, но только небольшие языковые модели. У обычного VPS нет видеокарты, поэтому всё считает процессор. Современные Ryzen для этого неплохи: у них быстрые ядра с AVX2/AVX-512, а llama.cpp и Ollama хорошо оптимизированы под CPU. Ограничение — память: её мало, а пропускная способность делится с соседями по физическому серверу.
Для примера возьмём линейку Ryzen-VPS у AlfaHost (Нидерланды, выделенные vCPU, NVMe). Конфигурации на момент написания:
| Тариф | vCPU | RAM | NVMe | Цена в месяц | Что потянет |
|---|---|---|---|---|---|
| RZ-4 | 2 | 4 ГБ | 50 ГБ | $13,5 | модели 1–2B, эмбеддинги, Whisper small |
| RZ-5 | 4 | 8 ГБ | 70 ГБ | $20 | модели до 4B комфортно, 8–9B медленно |
| RZ-6 | 8 | 12 ГБ | 100 ГБ | $40 | модели 8–9B с нормальным контекстом |
| RZ-7 | 12 | 16 ГБ | 150 ГБ | $55 | модели 8–14B, gpt-oss-20b впритык |
| Свой конфиг | до 16 | до 32 ГБ | до 1 ТБ | по калькулятору | gpt-oss-20b и MoE-модели до ~30B в Q4 |
Наличие конфигураций в локациях периодически меняется — актуальные тарифы смотрите на странице VPS. Полезная мелочь: в панели можно выбрать режим процессора host-passthrough, чтобы виртуалка видела все инструкции CPU, — llama.cpp от этого заметно выигрывает.
Какой скорости ждать
Ниже — ориентир для 4–8 vCPU на Ryzen с квантованием Q4. Это оценка по пропускной способности памяти и отзывам пользователей; реальная цифра зависит от поколения процессора, частоты памяти и загрузки соседей.
| Модель | Файл Q4 | RAM с запасом | Генерация на CPU |
|---|---|---|---|
| Qwen3.5 0.8B | 1 ГБ | 2 ГБ | 20–40 токенов/с |
| Qwen3.5 2B | 2,7 ГБ | 4 ГБ | 10–20 токенов/с |
| Qwen3.5 4B | 3,4 ГБ | 6 ГБ | 6–12 токенов/с |
| Qwen3.5 9B, Llama 3.1 8B | 5–6,6 ГБ | 8–10 ГБ | 3–6 токенов/с |
| gpt-oss-20b (MoE) | 14 ГБ | 16–20 ГБ | 5–10 токенов/с на 8+ vCPU |
Пять токенов в секунду — это примерно скорость неспешного чтения. Для фоновых задач хватает, для живого чата уже тягуче. Отдельная боль CPU — обработка длинного запроса: если скормить модели документ на 5–10 тысяч токенов, первая буква ответа может появиться через минуту-другую.
Что разумно делать на CPU-VPS
- Telegram- или Matrix-бот с небольшой моделью для ответов по шаблонам и классификации сообщений.
- Суммаризация, перевод и разметка текстов в фоне, когда ответ не нужен мгновенно.
- Эмбеддинги и поиск по своим заметкам (RAG): модели для эмбеддингов маленькие и быстрые даже на CPU.
- Расшифровка аудио через whisper.cpp — модели small и medium работают на процессоре приемлемо.
- Тестовый стенд: проверить API, промпты и интеграции, прежде чем платить за GPU.
Чего на CPU-VPS делать не стоит. Модели 30B+ с плотной архитектурой будут выдавать 1–2 токена в секунду. Генерация картинок технически запускается, но одно изображение SDXL занимает минуты, а FLUX — ещё дольше. Видео на процессоре практически непригодно: один короткий клип может считаться часами.
Быстрый старт на VPS
Установка Ollama и первая модель — две команды:
curl -fsSL https://ollama.com/install.sh | sh
ollama run qwen3.5:4b
По умолчанию Ollama слушает только 127.0.0.1:11434 и не спрашивает пароль. Так и оставьте: открытый в интернет API любой сможет использовать как бесплатный сервер. С домашнего компьютера подключайтесь через SSH-туннель, а сам сервер защитите по памятке по безопасности VPS.
ssh -N -L 11434:127.0.0.1:11434 user@your-vps
# теперь http://localhost:11434 на вашем ПК ведёт к Ollama на сервере
Серверы с GPU для серьёзных задач
Если нужна модель уровня 27–35B для кода, генерация картинок или видео, нужна видеокарта. Главный параметр — объём видеопамяти (VRAM): модель должна поместиться в неё целиком, иначе скорость падает в разы.
| VRAM | Типичные карты | Что помещается |
|---|---|---|
| 16 ГБ | RTX 4060 Ti 16 ГБ, RTX 5070 Ti, RTX 5080 | LLM до ~24B в Q4, SDXL и FLUX в GGUF, Wan 2.2 5B |
| 24 ГБ | RTX 3090, RTX 4090 | Qwen3.6 27B и Qwen3-Coder 30B, FLUX dev в FP8, Wan 2.2 14B в FP8 |
| 32 ГБ | RTX 5090 | то же с запасом на контекст, LTX-2 в FP8 комфортно |
| 48 ГБ | RTX 6000 Ada, A6000 | модели 70B в Q4, длинный контекст, LoRA для картинок |
| 80–96 ГБ | A100 80 ГБ, H100, RTX PRO 6000 | gpt-oss-120b, 70B в Q8, обучение LoRA для видео |
Аренда GPU по часам
Для экспериментов выгоднее всего почасовая аренда: запустили сервер, поработали, удалили — платите только за время. В России с оплатой в рублях это предлагают несколько провайдеров (цены — ориентир на момент написания):
- immers.cloud — облачные серверы с RTX 3090, RTX 4090, A100 и H100, посекундное списание, пополнение от 100 ₽. RTX 4090 — от ~83 ₽ в час, H100 — от ~340 ₽ в час.
- Selectel — облачные серверы с GPU (RTX 4090, A100, A30, RTX 6000 Ada и другие) и выделенные серверы с видеокартами помесячно. По калькулятору RTX 4090 стоит около 75 ₽ в час, A100 80 ГБ — около 290 ₽.
- Cloud.ru и Yandex Cloud — A100, H100, T4 и сервисы для ML. Ориентированы на компании: крупные конфигурации, квоты на GPU выдают по заявке.
Простое правило: если GPU нужен меньше 15–20 часов в неделю, аренда почти всегда дешевле покупки. Если модель должна работать круглосуточно (бот, сервис для команды), посчитайте выделенный сервер с GPU помесячно или собственное железо.
Перед арендой подготовьте сценарий: какой образ (Ubuntu с CUDA), какие модели скачать, куда сохранить результаты. Иначе половина оплаченного часа уйдёт на установку драйверов и загрузку десятков гигабайт весов.
Приватные варианты с оплатой криптовалютой
Часть зарубежных GPU-площадок принимает криптовалюту и не просит документы: для регистрации хватает почты или кошелька. Обычно это децентрализованные маркетплейсы, где видеокарты сдают частные владельцы и небольшие дата-центры. Цены в долларах — ориентир, на маркетплейсах они меняются каждый час:
- Clore.ai — маркетплейс GPU с поминутной оплатой. Регистрация по почте, оплата в BTC или токене CLORE. RTX 4090 — примерно $0,2–0,5 в час. Режим spot дешевле, но вашу аренду может перебить другой арендатор.
- Akash Network — децентрализованное облако. Через Console Air со своим кошельком Keplr можно платить AKT или USDC без аккаунта на сайте. RTX 4090 — около $0,35–0,5 в час, H100 — около $2,6.
- io.net — сеть GPU на блокчейне Solana. Оплата в USDC (комиссия 2%) или токеном IO, вход по почте или через GitHub. RTX 4090 — около $0,25–0,37 в час.
- Vast.ai — тоже принимает криптовалюту, но через BitPay и Crypto.com: эти платёжные сервисы могут запросить верификацию, а кредиты, купленные за криптовалюту, не возвращаются.
Насколько это приватно. Платежи в блокчейне псевдонимны, а не анонимны: все транзакции публичны и при желании связываются с биржей, где вы покупали монеты. Кроме того, на маркетплейсе ваша задача работает на чужом компьютере, и его владелец технически может добраться до диска и памяти. Не загружайте туда персональные данные, ключи доступа и коммерческие документы — для конфиденциальных задач надёжнее собственный мини-ПК, о котором ниже.
Правовой момент. В России цифровая валюта не является законным средством платежа, порядок её оборота определяет закон № 259-ФЗ. Перед оплатой зарубежного сервиса криптовалютой оцените правовые и налоговые последствия. Для большинства читателей из России проще и спокойнее провайдеры с оплатой в рублях из списка выше.
Мини-ПК для локальных моделей дома
Домашний сервер под локальные ИИ-модели окупается, если пользоваться им каждый день. Но «тянет модель» и «с ним комфортно работать» — разные вещи. На скорость влияют три характеристики, и у разных мини-ПК они сильно различаются:
- Объём памяти определяет, поместится ли модель целиком. Если нет — скорость падает в разы.
- Пропускная способность памяти определяет скорость генерации ответа — сколько токенов в секунду вы видите на экране.
- Вычислительная мощность GPU определяет, как быстро модель «прочитает» запрос, прежде чем начнёт отвечать, и как быстро рисуются картинки.
Третий пункт часто упускают, а для вайбкодинга он главный. Агент вроде Cline или Aider на каждом шаге отправляет модели 10–30 тыс. токенов: системные инструкции, открытые файлы, историю правок. Если GPU обрабатывает запрос со скоростью 100 токенов в секунду, каждый шаг агента начинается с паузы в 2–5 минут. Генерация изображений тоже упирается в вычисления, а не в память.
Что считать комфортной работой
- Вайбкодинг: модель уровня Qwen3-Coder 30B или Qwen3.6 35B-A3B и выше, генерация от 30 токенов в секунду, обработка запроса от 500–1000 токенов в секунду — тогда контекст в 20 тыс. токенов читается за 20–40 секунд, а не за минуты.
- Картинки: SDXL в 1024×1024 — до 10–20 секунд на изображение, FLUX — до 30–60 секунд. Медленнее можно, но подбирать промпт и перебирать варианты становится утомительно.
По этим критериям мини-ПК делятся на две группы: те, что уже подходят для ежедневной работы с кодом и изображениями, и бюджетные варианты для чата, автодополнения и знакомства с локальными моделями.
Мини-ПК, которые уже подходят для вайбкодинга и картинок
| Вариант | Цена в России | Вайбкодинг | Картинки | Видео |
|---|---|---|---|---|
| Мини-ПК + RTX 3090 / 5060 Ti через OCuLink | 140–200 тыс. ₽ | отлично для моделей до 30B | лучший вариант за свои деньги | да, Wan 2.2 и LTX в FP8 |
| Ryzen AI Max+ 395, 64–128 ГБ | от 200 тыс. ₽ | отлично, включая модели 80–120B | приемлемо: SDXL ~20 с, FLUX ~1–1,5 мин | медленно |
| Mac mini M5 Pro, 48–64 ГБ | от 270 тыс. ₽ | хорошо для моделей до 35B | средне | медленно |
| ASUS ROG NUC 16 с RTX 5080 Laptop | от $3449, в России редкость | хорошо для моделей до 20–30B | быстро | да, с ограничением 16 ГБ |
| NVIDIA DGX Spark | $4–5 тыс. | отлично, модели до 120B | приемлемо: SDXL ~12 с, FLUX ~35 с | да, но небыстро |
Мини-ПК с внешней видеокартой через OCuLink
Самый выгодный способ получить дома и быстрый вайбкодинг, и быструю генерацию картинок. Порт OCuLink (PCIe 4.0 x4) есть у многих мини-ПК на Ryzen 7 8845HS / H 255 и Ryzen AI 9 HX 370. К нему подключается док-станция с блоком питания и обычной настольной видеокартой. Днём это тихий мини-ПК, а для тяжёлых задач работает полноценная RTX. Для инференса четырёх линий PCIe хватает: модель загружается в видеопамять один раз и дальше работает почти на полной скорости карты.
Примерный бюджет по ценам сентября 2026 года:
- мини-ПК с OCuLink и 32 ГБ — 50–80 тыс. ₽ (варианты — в разделе про средний уровень ниже);
- док-станция вроде AOOSTAR AG02 со встроенным блоком питания — около 14 тыс. ₽;
- видеокарта: RTX 5060 Ti 16 ГБ — 73–86 тыс. ₽ новая, RTX 3090 24 ГБ — 80–100 тыс. ₽ на вторичном рынке (за лето подорожала именно из-за спроса на локальный ИИ), RTX 5070 Ti 16 ГБ — 130–140 тыс. ₽.
Связка с RTX 3090 — самая универсальная: 24 ГБ хватает, чтобы целиком загрузить Qwen3-Coder 30B или Qwen3.6 35B-A3B в 4-битном кванте. Генерация идёт быстрее 100 токенов в секунду, а длинный контекст обрабатывается за секунды. SDXL рисует картинку примерно за 5–6 секунд, FLUX в FP8 — за 20–30 секунд, есть запас под Wan 2.2 и LTX для видео. RTX 5060 Ti 16 ГБ дешевле и тише. В неё целиком помещается gpt-oss-20b, а 30B-модели работают с частичной выгрузкой экспертов в оперативную память (параметр --n-cpu-moe в llama.cpp) — медленнее, но всё ещё комфортно. Для картинок 16 ГБ хватает на SDXL и FLUX в FP8 или GGUF.
Минусы: на столе две коробки вместо одной, док с картой шумит под нагрузкой, а горячее подключение OCuLink не поддерживает — видеокарту подключают при выключенном ПК.
AMD Ryzen AI Max+ 395 (Strix Halo) — всё в одном корпусе
GMKtec EVO-X2, Framework Desktop, Beelink GTR9 Pro и аналоги. Главная фишка — до 128 ГБ быстрой LPDDR5X (~256 ГБ/с), из которых видеоядру Radeon 8060S можно отдать 96 ГБ, а в Linux и больше. Это лучший компактный вариант для вайбкодинга: в тестах на llama.cpp с Vulkan Qwen3-Coder 30B генерирует 70–100 токенов в секунду и обрабатывает запрос со скоростью около 1400 токенов в секунду, причём скорость почти не проседает до 8 тыс. токенов контекста. Qwen3-Coder-Next на 80B выдаёт около 60 токенов в секунду, gpt-oss-120b — около 50. Плотные модели на 70B — только около 5 токенов в секунду.
С картинками Strix Halo справляется, но без рекордов. По данным AMD, на ROCm 7.2 SDXL в 1024×1024 рисуется примерно за 18–25 секунд, полноразмерный FLUX.1 dev — около 80 секунд. Зато в 96 ГБ помещаются модели и цепочки, которые не влезают в 16–24 ГБ видеокарты, — например, FLUX в полной точности вместе с ControlNet или Wan 2.2 14B для видео, хотя ролик будет считаться долго. Часть свежих оптимизаций для ComfyUI выходит сначала только для NVIDIA.
Версия на 128 ГБ стоит примерно $2000–2200 в официальных магазинах. В российской рознице самый доступный вариант — GMKtec EVO-X2 на 64 ГБ и 1 ТБ примерно за 200 тыс. ₽, модели Beelink и Minisforum стоят 300–400 тыс. ₽. Для вайбкодинга на 30–35B-моделях и картинок хватает 64 ГБ, для моделей на 80–120B нужна версия на 128 ГБ. Память распаяна, докупить её потом нельзя.
Mac mini на M5 Pro
В августе 2026 года Apple обновила Mac mini: версия на M6 (до 32 ГБ общей памяти, 170 ГБ/с, от $899) и на M5 Pro (24, 48 или 64 ГБ, 307 ГБ/с, от $1699). Главное изменение для ИИ — нейроускорители в каждом ядре GPU: обработка длинных запросов стала в 3–4 раза быстрее, чем у M4 Pro, а это именно то, что ощущается в работе с агентом. Ollama и LM Studio поддерживают формат MLX, а на 48–64 ГБ комфортно работают Qwen3.6 27B/35B и Devstral Small 2. Ограничение — потолок в 64 ГБ: модели вроде gpt-oss-120b в Mac mini уже не помещаются.
Картинки генерируются через ComfyUI или Draw Things. По первым тестам M6 рисует изображение FLUX примерно за 35 секунд против полутора минут у M4, M5 Pro быстрее за счёт большего числа ядер GPU, но до RTX всё равно далеко. В российской рознице Mac mini M6 стоит около 200 тыс. ₽, M5 Pro — около 270 тыс. ₽. Базовый M6 на 16–24 ГБ для вайбкодинга тесноват: поместятся модели до 14B или gpt-oss-20b.
Компактные ПК со встроенной RTX
Если не хочется внешнего дока, есть мини-ПК с дискретной видеокартой внутри. Самый мощный — ASUS ROG NUC 16 объёмом около 3 литров: Core Ultra 9 290HX Plus и до RTX 5080 Laptop с 16 ГБ GDDR7. Для картинок это быстрый вариант — FLUX в FP8 помещается целиком, а для кода 16 ГБ хватает на gpt-oss-20b и 30B-модели с частичной выгрузкой. Минус — цена: от $3449 за версию с RTX 5080, а в России такие машины встречаются редко и стоят дороже. Мобильная RTX 5080 к тому же заметно слабее настольной, так что по соотношению цены и скорости связка мини-ПК с OCuLink и настольной картой выигрывает.
NVIDIA DGX Spark
DGX Spark — настольный «суперкомпьютер» на чипе GB10 со 128 ГБ общей памяти и полноценным стеком CUDA. По скорости генерации он близок к Strix Halo, но заметно быстрее обрабатывает длинные запросы: на gpt-oss-120b — около 1700 токенов в секунду на чтение и 55 на генерацию. Картинки рисует примерно в 2,5 раза быстрее Strix Halo: SDXL — около 12 секунд, FLUX.1 dev после прогрева — около 35. Все свежие оптимизации ComfyUI и инструменты для дообучения работают из коробки. Стоит порядка $4–5 тыс., так что это выбор для разработчиков, которым нужен именно CUDA и 128 ГБ памяти в одной коробке.
Средний уровень: мини-ПК на Ryzen 7 и Ryzen AI 9 с 32 ГБ
Самые ходовые мини-ПК осени 2026 года построены на восьмиядерных Ryzen 7 H 255, 8845HS и 7840HS с графикой Radeon 780M — по сути, это один и тот же чип под разными названиями. Ступенькой выше — Ryzen AI 9 365, HX 370 и HX 470 с Radeon 880M/890M. Встроенная графика использует обычную оперативную память, поэтому решают объём и двухканальный режим: выбирайте модели с двумя слотами SO-DIMM и ставьте минимум 32 ГБ. NPU на 50+ TOPS для LLM пока почти не используется — это цифра для маркетинга, а не скорость генерации.
Что получится. Через LM Studio или llama.cpp с бэкендом Vulkan такие машины уверенно запускают модели 7–14B и MoE вроде gpt-oss-20b и Qwen3-Coder 30B: на коротких запросах генерация идёт со скоростью 20–30 токенов в секунду. Для чата, вопросов по коду и автодополнения в редакторе этого достаточно. Но обработка запроса на Radeon 780M — около 400 токенов в секунду на пустом контексте и 60–130 на контексте в 32 тыс. токенов. Поэтому агентный вайбкодинг с длинным контекстом здесь идёт с паузами в несколько минут на каждом шаге. Картинки SDXL генерируются, но в разы медленнее, чем на RTX, FLUX и видео — скорее для экспериментов.
Главный плюс этого класса — апгрейд: у многих моделей есть OCuLink, и мини-ПК можно превратить в связку с внешней видеокартой из раздела выше. Цены — ориентир с Ozon на сентябрь 2026 года, для товаров из-за рубежа уже с пошлиной:
- Баребоны на 8845HS / H 255 с OCuLink (GMKtec K8 Plus, AOOSTAR GEM12 Max, Firebat) — корпус с платой от 23–30 тыс. ₽. Лучшая основа под внешнюю видеокарту, но учтите: из-за дефицита памяти модуль DDR5 SO-DIMM на 16 ГБ сейчас стоит от 20 тыс. ₽, и готовая сборка с 32 ГБ нередко выходит дешевле баребона с купленной отдельно памятью.
- Firebat AM02 (Ryzen 7 H 255, 16 ГБ DDR5-5600, 512 ГБ) — от 50 тыс. ₽. Память в слотах, так что сразу планируйте апгрейд до 32–64 ГБ.
- Firebat A8 (Ryzen AI 9 365, 24 ГБ DDR5-5600, 1 ТБ) — от 70 тыс. ₽. Графика Radeon 880M и Zen 5, 24 ГБ хватает для моделей до 14B и gpt-oss-20b.
- Мини-ПК на Ryzen AI 9 HX 370 с 32 ГБ — например, ICEBOOK Mini PC Ryzen AI (32 ГБ DDR5-6400, 1 ТБ) от 80 тыс. ₽ или GMKtec EVO-X1 с OCuLink. Это тот же класс, что и Minisforum AI X1 Pro, но заметно дешевле. Модели на HX 470 — от 105 тыс. ₽.
Экономный уровень: до 35–40 тыс. ₽
Подходит, чтобы попробовать локальные модели и держать дома небольшой ассистент на моделях 4–9B вроде Qwen3.5 4B/9B или компактных версий Gemma 4. Для вайбкодинга и картинок такие машины не годятся, но для чата, перевода и разбора текстов — вполне.
- Firebat F1 (Ryzen 5 7640HS, 24 ГБ DDR5-5600, 512 ГБ) — от 35 тыс. ₽. Лучший вариант в этой цене: 24 ГБ хватает даже для gpt-oss-20b, графика Radeon 760M работает через Vulkan.
- Мини-ПК на Intel N150 с 16 ГБ — от 30–35 тыс. ₽. Годятся только для моделей на 1–4B и как сервер для лёгких задач. Если бюджет позволяет, лучше доплатить за Ryzen.
Чего избегать
- Конфигураций с 8–12 ГБ и с распаянной памятью на 16 ГБ — её не расширить, а для моделей это главный ресурс.
- Подозрительно дешёвых лотов вроде «N150, 16 ГБ, 2 ТБ за 25 тыс. ₽»: в отзывах встречаются случаи, когда вместо заявленного приходит старое железо.
- Покупки «под ИИ» ради NPU: на скорость локальных LLM и генерации картинок он пока почти не влияет.
- Плат Jetson как домашнего сервера: Orin Nano Super с 8 ГБ запускает только маленькие модели, а Jetson AGX Thor создан для робототехники и стоит дороже DGX Spark.
- Заказа из-за рубежа через Ozon Global без проверки продавца: закладывайте пошлину и читайте отзывы — гарантия в таком случае часто сводится к возврату через маркетплейс.
Что выбрать
- Вайбкодинг и картинки за разумные деньги — мини-ПК с OCuLink и 32 ГБ плюс RTX 3090 или RTX 5060 Ti 16 ГБ в доке: 140–200 тыс. ₽.
- Вайбкодинг с большими моделями в одной тихой коробке — Ryzen AI Max+ 395 на 64–128 ГБ. Картинки тоже будут, но медленнее, чем на RTX.
- Тишина и экосистема Apple — Mac mini M5 Pro на 48–64 ГБ.
- CUDA, дообучение и модели до 120B — DGX Spark.
- Чат и автодополнение кода — мини-ПК на Ryzen 7 H 255 или HX 370 с 32 ГБ за 50–80 тыс. ₽, с возможностью позже добавить видеокарту через OCuLink.
- Попробовать без вложений — ваш текущий компьютер с 16 ГБ RAM и модели на 4–9B.
Мини-ПК удобно держать включённым круглосуточно как домашний сервер — например, рядом с Proxmox на мини-ПК. Для доступа к нему извне без открытых портов подойдёт OpenZiti.
Локальные модели для генерации изображений
| Модель | Чем хороша | VRAM | Лицензия |
|---|---|---|---|
| SDXL | огромная библиотека LoRA и стилей, работает почти везде | 6–8 ГБ | открытая (OpenRAIL++) |
| FLUX.1 [schnell] / [dev] | точно следует запросу, фотореализм | ~7 ГБ в GGUF Q4, ~12 ГБ в FP8, 24 ГБ без сжатия | schnell — Apache 2.0, dev — некоммерческая |
| FLUX.2 [klein] 4B | новинка 2026 года: быстро, 4 шага, хорошее качество | от 8 ГБ в GGUF | Apache 2.0 |
| FLUX.2 [dev] | максимум качества и редактирование | 24 ГБ+ с квантованием | некоммерческая |
| Z-Image Turbo | быстрый фотореализм за 8 шагов | до 16 ГБ | Apache 2.0 |
| Qwen-Image / Qwen-Image-2.1 | читаемый текст на картинке, редактирование | 12–16 ГБ в квантованных версиях | Apache 2.0 |
Qwen-Image-2.1 вышла 20 сентября 2026 года и сразу получила поддержку в ComfyUI. Если только начинаете, возьмите SDXL или FLUX.2 [klein]: они лучше всего подходят для карт на 8–12 ГБ.
Интерфейсы
- ComfyUI — узловой редактор схем. Сложнее на старте, зато новые модели (включая видео) появляются здесь первыми, а готовые схемы можно просто перетащить в окно.
- Forge — привычный интерфейс в стиле A1111, но быстрее и экономнее по памяти. Поддерживает FLUX.
- AUTOMATIC1111 — классика с горой расширений, но развивается медленно и требует больше VRAM.
- Fooocus — самый простой вариант «ввёл запрос — получил картинку». Работает только с моделями на базе SDXL и новые архитектуры не поддерживает.
Локальные модели для генерации видео
Видео — самая прожорливая задача. Даже на RTX 4090 клип на 5 секунд в 720p считается от минуты до десятка минут, а системной памяти нужно 32–64 ГБ для выгрузки частей модели.
| Модель | Особенности | Минимум VRAM | Комфортно |
|---|---|---|---|
| Wan 2.2 TI2V-5B | текст и картинка в видео, 720p, Apache 2.0 | ~8 ГБ с выгрузкой и GGUF | 12–16 ГБ |
| Wan 2.2 14B (T2V, I2V) | лучший реализм движения среди открытых моделей | 12–16 ГБ в FP8/GGUF | 24 ГБ |
| LTX-2 (версии 2.3 и 2.5) | самая быстрая, генерирует видео сразу со звуком | ~10–16 ГБ в GGUF/FP8 | 24–32 ГБ |
| HunyuanVideo 1.5 | 8,3B, кинематографичное движение | ~14 ГБ с выгрузкой | 24 ГБ |
У Wan более новые версии 2.5 и 2.6 доступны в основном через облако разработчика, открытые веса для скачивания — у Wan 2.2. Для LTX-2.5 разработчики официально указывают минимум 32 ГБ VRAM. У HunyuanVideo собственная лицензия Tencent с ограничениями — прочитайте её, если планируете коммерческое использование. Все три модели запускаются через ComfyUI.
Если видео нужно пару раз в месяц, честнее арендовать RTX 4090 или A100 на несколько часов, чем покупать карту за сотни тысяч рублей.
Модели для вайбкодинга
Вайбкодинг — когда вы описываете задачу словами, а ИИ-агент сам читает проект, правит файлы и запускает команды. Локальная модель для этого должна уметь вызывать инструменты и держать длинный контекст. Актуальные варианты на осень 2026 года (размеры — из библиотеки Ollama):
| Модель | Тип | Размер Q4 | Где запускать |
|---|---|---|---|
| Qwen3.6 27B / 35B | плотная / MoE (3B активных) | 18–24 ГБ | GPU 24 ГБ, Mac на 32–48 ГБ |
| Qwen3-Coder 30B | MoE, 3,3B активных | 19 ГБ | GPU 24 ГБ, Mac на 32 ГБ |
| Devstral Small 2 (24B) | плотная, Apache 2.0 | 15 ГБ | GPU 16–24 ГБ |
| gpt-oss-20b | MoE, ~3,6B активных | 14 ГБ | 16 ГБ памяти, даже без GPU |
| GLM-4.7-Flash | MoE класса 30B | 19 ГБ | GPU 24 ГБ |
| Qwen3-Coder-Next | MoE 80B, 3B активных | 52 ГБ | 64–128 ГБ общей памяти |
| gpt-oss-120b | MoE, ~5B активных | 65 ГБ | Strix Halo, DGX Spark, GPU 80 ГБ |
| Devstral 2 (123B) | плотная | ~75 ГБ | 128 ГБ общей памяти, медленно |
| DeepSeek-V4-Flash | MoE 284B, 13B активных | ~103 ГБ в 3-bit | от 128 ГБ, проще через API |
Для автодополнения в редакторе нужна отдельная маленькая и быстрая модель, например qwen2.5-coder:1.5b: она подсказывает строку за доли секунды даже на ноутбуке.
Связка: движок плюс редактор
- Движок: Ollama (проще всего), LM Studio (удобный графический интерфейс) или
llama-serverиз llama.cpp (максимум настроек). Все дают API по адресу видаhttp://localhost:11434или:1234. - Continue — расширение для VS Code и JetBrains: чат, правки и автодополнение на локальной модели.
- Cline — агент в VS Code: сам читает файлы, предлагает изменения и запускает команды с вашего подтверждения.
- Aider — агент в терминале, работает через git и делает коммит на каждое изменение.
- Cursor умеет работать с собственным OpenAI-совместимым адресом, но запросы идут через серверы Cursor, поэтому
localhostон не видит. Нужен доступный извне адрес с авторизацией, и полностью локальной такая схема уже не будет.
Пример конфигурации Continue (~/.continue/config.yaml):
name: Local
version: 0.0.1
schema: v1
models:
- name: Qwen3.6 27B
provider: ollama
model: qwen3.6:27b
roles: [chat, edit, apply]
- name: Autocomplete
provider: ollama
model: qwen2.5-coder:1.5b
roles: [autocomplete]
Aider с той же моделью запускается одной командой:
aider --model ollama_chat/qwen3.6:27b
Важная настройка: агентам нужен длинный контекст, а у Ollama по умолчанию он скромный. Увеличьте его, например переменной OLLAMA_CONTEXT_LENGTH=32768, иначе модель будет «забывать» начало файла и путаться. И будьте реалистами: локальные модели на 24 ГБ хорошо справляются со скриптами, небольшими проектами и рутиной, но в больших кодовых базах уступают топовым облачным моделям.
Сводная таблица: задача → модель → минимум железа

| Задача | Модели | Минимум | Комфортно |
|---|---|---|---|
| Чат, боты, тексты | Qwen3.5 4B–9B, Gemma 4 E4B, Llama 3.1 8B | CPU-VPS 4 vCPU / 8 ГБ RAM | любой GPU 8 ГБ или Mac 16 ГБ |
| Поиск по документам (RAG) | модель эмбеддингов + LLM на 4–9B | 4 vCPU / 8 ГБ RAM | GPU 8–12 ГБ |
| Расшифровка аудио | Whisper (whisper.cpp) | 2–4 vCPU | любой GPU |
| Вайбкодинг | Qwen3.6 27B, Qwen3-Coder 30B, Devstral Small 2, gpt-oss-20b | GPU 16 ГБ или 32 ГБ общей памяти | GPU 24–32 ГБ, Mac 48–64 ГБ |
| Большие модели | gpt-oss-120b, Qwen3-Coder-Next, Devstral 2 | 64 ГБ общей памяти | Ryzen AI Max+ 395 / DGX Spark на 128 ГБ |
| Картинки | SDXL, FLUX.2 [klein], Z-Image Turbo, Qwen-Image | NVIDIA 8 ГБ | NVIDIA 16–24 ГБ |
| Видео | Wan 2.2, LTX-2, HunyuanVideo 1.5 | NVIDIA 12–16 ГБ + 32 ГБ RAM | NVIDIA 24–32 ГБ + 64 ГБ RAM |
| Обучение LoRA | SDXL, FLUX, Wan | GPU 24 ГБ | аренда A100/H100 80 ГБ |
Типичные ошибки
- Смотреть на число параметров, а не на объём памяти. Модель, которая не влезла в VRAM, частично уходит в обычную RAM и замедляется в 5–10 раз.
- Брать CPU-VPS под картинки и видео. Для диффузионных моделей процессор не подходит — сразу смотрите в сторону GPU.
- Открывать Ollama или ComfyUI в интернет без пароля. Используйте SSH-туннель, VPN или reverse-proxy с авторизацией.
- Не учитывать контекст. Длинный контекст съедает гигабайты памяти сверх размера модели.
- Покупать железо до экспериментов. Сначала попробуйте модель в аренде на час или на текущем ПК — станет понятно, какой объём памяти нужен.
- Игнорировать лицензии. FLUX.1 [dev] и FLUX.2 [dev] запрещают коммерческое использование без отдельной лицензии, у HunyuanVideo свои ограничения.
С чего начать сегодня
- Поставьте Ollama или LM Studio на свой компьютер и запустите Qwen3.5 4B или gpt-oss-20b, если есть 16 ГБ памяти.
- Для круглосуточного бота возьмите Ryzen-VPS на 4–8 vCPU и 8–16 ГБ RAM, например у AlfaHost, и держите API закрытым.
- Для картинок и видео арендуйте RTX 4090 на пару часов и прогоните схемы в ComfyUI.
- Для кода подключите Continue или Cline к локальной модели и сравните с облачным ассистентом на своих задачах.
- Только после этого решайте, нужен ли домашний мини-ПК и на сколько гигабайт памяти.
Полезные ссылки
- Библиотека моделей Ollama · LM Studio · llama.cpp
- ComfyUI · Forge
- Wan 2.2 · Qwen-Image-2.1
- Continue · Cline · Aider
- Ryzen-VPS у AlfaHost · GPU в аренду на immers.cloud
Частые вопросы
Можно ли запустить нейросеть на VPS без видеокарты?
Да, небольшие языковые модели на 1–9B через Ollama или llama.cpp. На 4–8 vCPU Ryzen они выдают примерно 3–20 токенов в секунду в зависимости от размера. Для моделей крупнее 20B, картинок и видео нужен GPU.
Сколько памяти нужно для локальной модели?
При квантовании Q4 — около 0,6 ГБ на миллиард параметров плюс 1–4 ГБ на контекст. Модель на 8B займёт 5–6 ГБ, на 30B — 18–20 ГБ, на 120B — около 65 ГБ.
Можно ли генерировать картинки на процессоре?
Технически да, но одна картинка SDXL занимает минуты, а видео на CPU практически непригодно. Для изображений нужна видеокарта NVIDIA от 8 ГБ, для видео — от 12–16 ГБ.
Что лучше для дома: Mac mini или мини-ПК на Ryzen AI Max?
Mac mini M5 Pro до 64 ГБ — тихий вариант для моделей до 35B. Ryzen AI Max+ 395 со 128 ГБ дешевле в пересчёте на гигабайт и тянет модели масштаба 120B. Для картинок и видео оба уступают RTX: если нужны и код, и изображения, выгоднее мини-ПК с OCuLink и RTX 3090 или RTX 5060 Ti 16 ГБ во внешнем доке.
Какая локальная модель лучше для программирования?
На осень 2026 года при 24 ГБ VRAM — Qwen3.6 27B или Qwen3-Coder 30B, при 16 ГБ — Devstral Small 2 или gpt-oss-20b. При 128 ГБ общей памяти — Qwen3-Coder-Next или gpt-oss-120b.
Можно ли подключить локальную модель к Cursor?
Частично: Cursor принимает свой OpenAI-совместимый адрес, но запросы идут через его серверы, поэтому localhost не подойдёт. Для полностью локальной работы удобнее Continue, Cline или Aider.
Безопасно ли открывать Ollama в интернет?
Нет. По умолчанию у API нет пароля, и любой сможет пользоваться вашим сервером. Подключайтесь через SSH-туннель или VPN, а если нужен внешний доступ — через reverse-proxy с авторизацией.
Что выгоднее: арендовать GPU или купить видеокарту?
Если GPU нужен меньше 15–20 часов в неделю, аренда почти всегда дешевле. При круглосуточной нагрузке выгоднее выделенный сервер или своё железо.
Читайте также
- Hugging Face: где искать модели
- Безопасность VPS на Ubuntu и Debian
- OpenZiti: доступ к домашнему серверу без открытых портов
- Proxmox на мини-ПК
- Услуги: настройка self-hosted сервисов на VPS
Коротко: локальные ИИ-модели для ботов и фоновых задач спокойно работают на обычном Ryzen-VPS, если это небольшие языковые модели. Для кода на моделях 27–35B нужен GPU на 24 ГБ или Mac на 48–64 ГБ, для больших MoE-моделей — 128 ГБ общей памяти, а для картинок и видео — видеокарта NVIDIA, своя или арендованная. Вопросы по своей конфигурации задавайте в комментариях.
Без почты и трекеров — только лента обновлений.







