NPU процессор видит лишь половину RAM: реальный тест мини-ПК за 70 000 ₽ с Qwen3.6
Оригинал обрывается на середине предложения. Работаю строго по имеющимся фактам из источника.
Мини-ПК FIREBAT на Ryzen AI 9 365 за 70 тысяч рублей обещал стать тихим домашним сервером для локальных нейросетей, но путь от покупки до стабильно работающей модели Qwen3.6 на NPU процессоре оказался полон сюрпризов, которые полезно знать до покупки.
NPU процессор в потребительском мини-ПК впервые позволяет держать модель с 35 миллиардами параметров в режиме 24/7 без видеокарты, но реальные ограничения по памяти и софту делают эту затею пригодной далеко не для всех задач.
Автор разбора купил мини-ПК FIREBAT на чипе AMD Ryzen AI 9 365 со встроенным NPU процессором XDNA2 и графикой Radeon 880M. Задача была конкретная: запустить локальную языковую модель, которая отвечает быстрее, чем на голом CPU, и работает без облака. По дороге вскрылись проблемы, о которых маркетинг AMD умалчивает: NPU видит только половину оперативной памяти, драйверы недоступны из России, а гибридный режим NPU плюс встроенная графика на практике не работает для моделей крупнее 8 миллиардов параметров. Источник: личный технический разбор пользователя, опубликованный в открытом доступе.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Мини-ПК FIREBAT на Ryzen AI 9 365 (без памяти и SSD) | дата не указана | FIREBAT | около 30 000 рублей |
| 64 ГБ DDR5-4800 (2 модуля по 32 ГБ) | дата не указана | не указан | около 40 000 рублей |
| Итого с памятью (без SSD) | дата не указана | — | около 70 000 рублей (примерно 825 долларов) |
Что выяснилось на практике?
-
Привычные инструменты не видят NPU. Ollama, llama.cpp, LM Studio работают с CPU и GPU, но NPU процессор для них не существует. Для запуска модели на NPU нужен отдельный рантайм FastFlowLM (сокращённо flm), который отдаёт API, совместимый с форматом OpenAI.
-
Гибридный режим NPU плюс встроенная графика не работает для больших моделей. Lemonade Server от AMD обещает, что NPU быстро читает промпт (prompt, входной текст для модели), а встроенная графика генерирует ответ. Но гибрид доступен только для моделей до 8 миллиардов параметров: Llama 3.2 1B/3B, Llama 3.1 8B, Qwen3 до 8B, Mistral 7B, Phi-4-mini. Для Qwen3.6 с 35 миллиардами параметров гибрида нет.
-
NPU видит ровно половину оперативной памяти, которую видит система. Из 64 ГБ физической памяти Windows показала 47,6 ГБ (остальное BIOS зарезервировал под встроенную графику). NPU получил доступ к 23,8 ГБ, ровно к половине от этих 47,6. Модель Qwen3.6 весит около 20 ГБ, на кеш контекста остаётся 3,8 ГБ, и при двух одновременных запросах система падает.
-
Лечение: в BIOS выставить минимальный резерв под встроенную графику. После этого система увидела 63,1 ГБ, а пул NPU вырос до 31,6 ГБ. Модель заняла 21,2 ГБ, и запас стал достаточным.
-
На 32 ГБ оперативной памяти модель такого размера не живёт. По данным автора, в issue #242 проекта FastFlowLM у пользователей с 32 ГБ даже модель GPT-OSS-20B (около 14 ГБ) не работала стабильно. Формула: вес модели плюс запас на контекст должны помещаться в половину RAM за вычетом резерва под iGPU (встроенную графику).
-
Драйвер NPU из России скачать проблематично. Свежий драйвер лежит в составе Ryzen AI Software, но для скачивания AMD требует регистрацию и проверку страны. Автор не получил доступ из России, Казахстана и Нидерландов. Драйвер пришлось добывать обходным путём.
-
NPU обслуживает один запрос за раз. Если клиент отправил второй запрос, не дождавшись ответа на первый, FastFlowLM падает с ошибкой double free.
-
Итоговая производительность: prefill около 200 токенов в секунду, генерация ответа 13 до 17 токенов в секунду. Prefill (чтение входного промпта) это именно та операция, ради которой и нужен NPU процессор: на обычном CPU без видеокарты почти всё время уходило на чтение, а не на ответ.
-
Автор перешёл с Windows на Linux (Proxmox VE 9 на базе Debian 13). Гибридный режим провалился, а FastFlowLM одинаково работает на обеих системах. Модель Qwen3.6 с 35 миллиардами параметров и 3 миллиардами активных параметров на токен (архитектура MoE, когда на каждый токен работает не вся сеть, а только её часть) запущена на NPU напрямую на хосте и работает 24/7.
Как запустить модель на NPU за четыре шага?
-
Убедитесь, что у вас 64 ГБ оперативной памяти и процессор с NPU XDNA2. На 32 ГБ крупная модель не поместится. В BIOS выставьте минимальный резерв под встроенную графику (параметр UMA Frame Buffer Size или iGPU Memory).
-
Обновите драйвер NPU. Скачайте Ryzen AI Software с сайта AMD. Из России доступ может быть заблокирован, в этом случае понадобится VPN или помощь коллеги из другой страны.
-
Установите FastFlowLM. Рантайм доступен для Windows и Linux. Модели в формате .q4nx скачиваются из каталога FastFlowLM на Hugging Face.
-
Запустите модель и подключите интерфейс. FastFlowLM отдаёт API в формате OpenAI, к нему подключается Open WebUI или любой совместимый клиент. Если используете Open WebUI, ограничьте параметр CHAT_RESPONSE_MAX_TOOL_CALL_ITERATIONS значением 2 или 3 вместо 256 по умолчанию, иначе модель с малым числом активных параметров уходит в бесконечный цикл вызовов инструментов.
Облако или свой NPU процессор: честное сравнение для автора из России
Для авторов и маркетологов в РФ доступны облачные альтернативы: YandexGPT и GigaChat. Обе закрытые модели (closed-source, исходный код и веса недоступны), обе работают через API без возражений по геолокации, обе не требуют покупки железа. Локальный NPU процессор даёт другое: полный контроль над данными, отсутствие абонентской платы и возможность работать без интернета. Но порог входа высокий: 70 тысяч рублей за железо, несколько часов на настройку и готовность решать проблемы с драйверами самостоятельно. Для большинства авторов Дзена облачные сервисы остаются проще и дешевле, локальный NPU процессор оправдан, если вы обрабатываете чувствительные данные или хотите бесперебойный сервис без подписки.
Что это значит для вашей работы?
Автору на Дзене. Локальная модель на NPU процессоре позволяет генерировать черновики, разбирать изображения и проверять тексты без подписки на облачный сервис. Но 13 до 17 токенов в секунду при генерации ответа это ощутимо медленнее, чем облачные API. Для потоковой работы с текстами модель подойдёт как фоновый помощник, а не как замена быстрого облака.
Маркетологу. Если вы обрабатываете клиентские данные, которые нельзя отправлять в облако, локальный NPU процессор решает вопрос приватности. Один запрос за раз и падения при параллельных обращениях означают, что для командной работы нескольких человек одновременно решение пока не годится.
Предпринимателю в РФ. Заблокированный доступ к драйверам AMD из России это реальная проблема. Закладывайте время и бюджет на обход ограничений. Альтернатива: дождаться, пока llama.cpp или Ollama научатся работать с NPU напрямую, тогда зависимость от проприетарного рантайма FastFlowLM и драйверов AMD снизится.
Этот разбор ценен не результатом, а дорогой к нему. На бумаге NPU процессор в мини-ПК за 70 тысяч рублей звучит как доступный домашний сервер для нейросетей. На практике автор потратил часы на квест с драйверами, обнаружил, что 64 ГБ памяти это не запас, а минимум, и выяснил, что разрекламированный гибридный режим не работает для серьёзных моделей.
По моим наблюдениям, для большинства авторов и маркетологов в РФ облачные YandexGPT и GigaChat сейчас практичнее: работают из коробки, не требуют возни с BIOS и VPN для скачивания драйверов. Но если вам критична приватность данных или бесперебойная работа без интернета, NPU процессор в мини-ПК это уже рабочий вариант, просто не такой простой, как обещает маркетинг AMD.
Что сделать сегодня: если задумались о покупке, запомните формулу из разбора. Вес модели плюс запас на контекст должны помещаться в половину оперативной памяти минус резерв под встроенную графику. Для моделей класса 35 миллиардов параметров это 64 ГБ, не меньше.
Частые вопросы
Можно ли запустить нейросеть на NPU процессоре с 32 ГБ памяти?
Для крупных моделей (от 14 миллиардов параметров и выше) 32 ГБ недостаточно. NPU видит только половину доступной системе оперативной памяти, то есть около 16 ГБ. Модели поменьше (до 8 миллиардов параметров) могут поместиться, но запаса на кеш контекста почти не останется.
Зачем нужен именно NPU, если есть обычный процессор?
NPU процессор ускоряет prefill, чтение входного промпта. На обычном CPU без видеокарты почти всё время уходит именно на этот этап. В разборе prefill на NPU дал около 200 токенов в секунду, это качественно быстрее, чем на CPU. Генерация ответа (decode) при этом упирается в скорость памяти, и здесь NPU не даёт кратного преимущества.
Доступен ли драйвер AMD NPU из России?
По опыту автора разбора, AMD блокирует скачивание Ryzen AI Software из России, Казахстана и Нидерландов. Для получения драйвера понадобится VPN или помощь из страны без ограничений.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

AMD FSR работает на любом железе, но проигрывает DLSS в качестве: разбор компромиссов
AMD FSR выросла из математики прошлого века и стала единственным апскейлером для миллионов владельцев старых и бюджетных видеокарт, пока NVIDIA три года…
Уязвимость в Microsoft Update Catalog обнаружена
Исходный текст не содержит информации об уязвимости Microsoft Update Catalog. Оригинал рассказывает о том, как непрограммист создал локальное приложение для…

Reddit закрывает публичный API и RSS: бесплатный доступ к данным на $43 млн исчезнет к 2027 году
Reddit второго июня объявил о закрытии RSS-каналов и публичного API, лишая разработчиков, исследователей и обычных читателей бесплатного доступа к одному из…
Комментарии