Мини-ПК на Ryzen AI Max+ 395 вмещает модели до 235B: облако больше не нужно
Локальный запуск больших языковых моделей без облака и серверных видеокарт перестал быть фантазией: мини-ПК на базе Ryzen AI Max+ 395 с 128 ГБ общей памяти уже продаётся на российских маркетплейсах и вмещает модели до 235 миллиардов параметров.

Впервые устройство размером с литровую коробку позволяет загрузить в память 70B-модель целиком и получить 5,5–7,5 токенов в секунду, что раньше требовало пары настольных видеокарт RTX 4090 по 24 ГБ каждая.
Откуда взялась эта «коробочка» и почему сейчас?
Процессор AMD Ryzen AI Max+ 395 на архитектуре Strix Halo компания AMD представила на выставке CES в январе 2025 года. Китайские фабрики начали отгружать готовые устройства весной, но до российских площадок конфигурации с топовыми 128 ГБ памяти добрались только к осени-зиме 2025 года.
Конкретную реализацию выпустила компания FEVM (Shenzhen Feimin Technology), которая специализируется на компактных рабочих станциях. Инженеры упаковали платформу в цельнометаллический алюминиевый корпус объёмом в 1 литр.
Главное для работы с нейросетями: 128 ГБ распаянной памяти LPDDR5X-8000 по 256-битной шине (восемь 32-битных каналов) с пиковой пропускной способностью 256 ГБ/с. Память общая для процессора и графического ядра Radeon 8060S (40 вычислительных блоков, архитектура RDNA 3.5, 2560 потоковых процессоров).
Под Linux через параметры драйвера amdgpu графическому ядру можно выделить до 110–112 ГБ под буфер весов. Под Windows через настройки UMA в BIOS доступно до 96 ГБ.
Что понадобится
- Устройство: мини-ПК FEVM на Ryzen AI Max+ 395 с 128 ГБ LPDDR5X (доступен на Ozon Global, от 230 000 до 280 000 рублей)
- Операционная система: Linux (Ubuntu 22.04 или новее) для максимального объёма доступной видеопамяти, либо Windows 11
- Драйвер и стек: ROCm 7.x (открытый вычислительный стек AMD для GPU) под Linux
- Программа для инференса (запуска модели и генерации текста): llama.cpp или Ollama
- Файлы весов моделей: скачиваются с Hugging Face, квантованные (сжатые с потерей точности) версии формата Q4_K_M
- Время на настройку: от 2 до 4 часов на первый запуск с нуля, включая установку драйверов
Пошаговая инструкция
-
Установите Linux и обновите систему. Ubuntu 22.04 LTS или новее. Под Linux графическому ядру доступно до 112 ГБ памяти вместо 96 ГБ под Windows, и это критично для моделей класса 70B и выше.
-
Установите драйвер amdgpu и стек ROCm 7.x. Следуйте официальной документации AMD. После установки проверьте, что GPU определяется корректно:
rocm-smi
-
Настройте пул памяти TTM/GTT, чтобы выделить графическому ядру максимум. Параметры передаются через драйвер amdgpu. Цель: 110–112 ГБ доступной видеопамяти.
-
Соберите или установите llama.cpp с поддержкой ROCm. Клонируйте репозиторий и соберите с флагом HIP (интерфейс AMD для вычислений на GPU):
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_HIP=ON
cmake --build build --config Release
-
Скачайте квантованную модель. Для первого теста возьмите Qwen 2.5 32B в формате Q4_K_M (файл весит около 20 ГБ). Для более мощной модели: Llama 3 70B Q4_K_M (около 40–42 ГБ).
-
Запустите инференс. Укажите путь к файлу весов и количество слоёв, выгружаемых на GPU:
./build/bin/llama-cli -m ./models/qwen2.5-32b-q4_k_m.gguf -ngl 99 -c 4096
Параметр -ngl 99 означает «все слои на GPU». Параметр -c 4096 задаёт длину контекста (количество токенов, которые модель «помнит» в рамках диалога).
- Проверьте скорость генерации. При правильной настройке ожидаемые показатели для Ryzen AI Max+ 395:
- Модели 7B–8B: 40–48 токенов в секунду
- Модели 14B: 22–26 токенов в секунду
- Модели 32B: 10–12 токенов в секунду
-
Модели 70B: 5,5–7,5 токенов в секунду
-
Для запуска моделей с архитектурой MoE (Mixture of Experts, «смесь экспертов», когда на каждом шаге работает только часть параметров): Qwen3-235B-A22B в формате Q4_K_M занимает 100–110 ГБ и целиком помещается в доступный пул. Скорость генерации: 10–13 токенов в секунду, потому что активных параметров на каждом токене только 21–22 миллиарда.
На мини-ПК FEVM с Ryzen AI Max+ 395 (128 ГБ, Linux, ROCm 7.x) загружена модель Llama 3 70B в формате Q4_K_M (файл ~42 ГБ). Все слои размещены на GPU, контекст 4096 токенов. Результат: стабильные 6–7 токенов в секунду в диалоговом режиме. Текст появляется примерно со скоростью неспешного чтения. Для чата с моделью, написания черновиков статей, анализа документов этого хватает. Для пакетной обработки сотен тысяч токенов или фонового агентного кодинга (когда ИИ-агент пишет и тестирует код самостоятельно) такая скорость уступает кластерам на дискретных картах с памятью GDDR6X или HBM.
Ожидание чудес от числа «235 миллиардов». Маркетинг заявляет запуск моделей на 200+ миллиардов параметров. Формально это правда: файл весов помещается в память. Но 235B в случае MoE-архитектуры не означает, что все параметры работают одновременно. На каждом токене активны только 21–22 миллиарда, и скорость определяется именно пропускной способностью шины, а не общим размером модели.
Покупка под Windows без учёта разницы в памяти. Под Windows через UMA в BIOS доступно до 96 ГБ видеопамяти, под Linux до 112 ГБ. Разница в 16 ГБ может решить, поместится модель целиком на GPU или нет.
Надежда на NPU. Встроенный блок XDNA 2 с заявленной мощностью 50 TOPS (триллионов операций в секунду) в llama.cpp, Ollama и vLLM для инференса больших языковых моделей на текущий момент не используется. Весь расчёт идёт через шейдерные блоки Radeon 8060S.
Игнорирование таможенной пошлины. Для зарубежных посылок дороже 200 евро действует ставка 15% с суммы превышения. При чеке около 240 000 рублей доплата таможне составит порядка 30 000–35 000 рублей. Итоговая стоимость: 260 000–315 000 рублей.
Скам на маркетплейсах. Себестоимость одной только распаянной платы со 128 ГБ памяти высока. Если продавец предлагает цену заметно ниже 230 000 рублей, стоит насторожиться.
Шум в профиле Performance. При лимите 130–150 Вт температура ядра выходит на 92–95 градусов, а шум достигает 47–49 дБ. Для жилой комнаты это громко. Профиль Balanced (85–100 Вт) держит 80–86 градусов при 38–40 дБ, но производительность ниже.
Что это значит для вас?
Авторам Дзена и копирайтерам. Модель на 32 миллиарда параметров, работающая локально со скоростью 10–12 токенов в секунду, закрывает задачи генерации черновиков, рерайта и анализа текстов без подписок на облачные сервисы и без отправки данных на внешние серверы. Никакой цензуры, никаких ограничений по тематике, полный контроль над данными.
Маркетологам. 70B-модель локально означает возможность обрабатывать конфиденциальные брифы и клиентские данные без риска утечки через API. Шесть-семь токенов в секунду на 70B хватает для интерактивной работы, но для массовой генерации тысяч карточек товаров производительности будет мало.
Предпринимателям в РФ и СНГ. Устройство доступно на Ozon Global. Бюджет с учётом таможни: 260 000–315 000 рублей. Для сравнения: две видеокарты RTX 4090 по 24 ГБ обойдутся дороже, потребуют полноразмерный ПК и дадут суммарно только 48 ГБ видеопамяти. Ryzen AI Max+ 395 в литровом корпусе даёт до 112 ГБ. Из российских облачных альтернатив для тех, кому не нужен именно локальный запуск: API YandexGPT и GigaChat, но у них свои ограничения по моделям и цензуре.
Ryzen AI Max+ 395 в реализации FEVM занимает уникальную нишу: это самый компактный способ запустить 70B-модель целиком на GPU без облака. Я бы не называл это устройством для всех. 260 000+ рублей и необходимость работать под Linux с настройкой драйверов ROCm отсекают большинство. Но для тех, кому критичны приватность данных и независимость от внешних API, на рынке сейчас нет ничего сопоставимого по соотношению объёма памяти к размеру корпуса. По моим наблюдениям, 6–7 токенов в секунду на 70B-модели вполне комфортны для работы в режиме «задал вопрос, получил развёрнутый ответ». Это не скорость для конвейера, но для эксперта, который думает между запросами, хватает. Честная оговорка: NPU пока бесполезен для LLM-инференса, а шум в режиме полной мощности делает устройство неудобным для открытого пространства. Если вам нужна тишина и модели не крупнее 14B, дешевле взять Mac Mini на M4 Pro.
Научитесь писать промпты, которые выжимают максимум из локальных моделей
В dzen.guru собраны практические гайды по промпт-инжинирингу для авторов, работающих с открытыми моделями на своём железе
Перейти к гайдамЛитровая коробка с Ryzen AI Max+ 395 не заменит облачный кластер и не даст скорости дискретных карт с HBM-памятью, но она впервые делает 70B-модели по-настоящему карманными: купил, настроил, запустил без подписок, без VPN и без чужих серверов.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

5 ошибок при запуске ИИ-агентов в продакшене: готовые решения из практики
Автор делится конкретными ошибками из опыта разработки ИИ-агентов в продакшене, и каждая из пяти проблем сопровождается готовым решением, которое экономит…

Как собрать рабочий набор инструментов искусственного интеллекта за один вечер
Рубрика задана как how-to, но оригинал — это каталог ссылок и ресурсов, а не пошаговая инструкция. Адаптирую формат: покажу, как собрать личный набор…

Искусственный интеллект в финтехе: агент Альфа-Банка сэкономил 20 человеко-дней в месяц
Продолжу анализ оригинала и напишу новость строго по фактам из него. Михаил Чернов, старший IT-лидер направления развития IT взыскания в Альфа-Банке, описал…
Комментарии