Мини-ПК с Ryzen AI 9 365: как запустить Qwen3.6–35B на NPU
Энтузиаст купил мини-ПК FIREBAT на Ryzen AI 9 365 с 64 ГБ RAM за 70 тыс. рублей, чтобы запустить локальную LLM на NPU. После проблем с драйверами и памятью он запустил Qwen3.6–35B-A3B через FastFlowLM на Proxmox, получив скорость 13–17 ток/с.
- Мини-ПК FIREBAT с Ryzen AI 9 365 и 64 ГБ RAM обошёлся в 70 тыс. рублей (~$825).
- NPU видит только половину оперативной памяти: после правки BIOS доступно 31,6 ГБ из 64 ГБ.
- FastFlowLM запускает Qwen3.6–35B-A3B на NPU с prefill около 200 ток/с и decode 13–17 ток/с.

Пользователь под ником (имя не указано) опубликовал на Хабре кейс о запуске большой языковой модели на NPU в мини-ПК. Он выбрал модель FIREBAT на процессоре AMD Ryzen AI 9 365 с 64 ГБ оперативной памяти. Корпус без памяти и SSD стоил 30 тыс. рублей, память DDR5–4800 (2×32 ГБ) — ещё 40 тыс. рублей. Итого около 70 тыс. рублей (~$825).
Целью было запустить Qwen3.6–35B-A3B — MoE-модель с примерно 3 млрд активных параметров, которая умеет разбирать картинки. Автор начал с Windows, чтобы использовать гибрид NPU+iGPU через Lemonade Server от AMD, но гибрид поддерживает только ONNX-модели до 8B, и для Qwen3.6–35B его нет. Пришлось перейти на FastFlowLM (flm) — отдельный рантайм под NPU с OpenAI-совместимым API.
Проблемы с драйвером и памятью
После установки flm на Windows ничего не работало: код возврата 0xC0000139 указывал на старый драйвер NPU. Свежий драйвер лежит в составе Ryzen AI Software, но для скачивания требуется регистрация и проверка страны. Автор не смог получить доступ из России, Казахстана и Нидерландов. Обновив драйвер, он запустил модель, но она падала с ошибкой DMA Paging Error 0xc01e0200 при двух одновременных запросах. Причина — NPU видит только половину оперативной памяти: Windows видела 47,6 ГБ из 64, а NPU — 23,8 ГБ. BIOS резервировал 15,8 ГБ под встроенную графику. После уменьшения UMA Frame Buffer Size в BIOS ОС стала видеть 63,1 ГБ, а пул NPU — 31,6 ГБ.
Автор также выяснил, что NPU загружен на 50–60% из-за нехватки пропускной способности памяти: у NPU около 60 ГБ/с против ~125 ГБ/с у iGPU. Для MoE-модели с 3B активных параметров вычислений мало, и decode упирается в память.
Переход на Proxmox и запуск на хосте
Поскольку гибрид не заработал, автор перешёл на Proxmox VE 9 (Debian 13). Попытка пробросить NPU в виртуальную машину не удалась — софт не поддерживает. Тогда он установил flm прямо на хост Proxmox, так как драйвер NPU уже в ядре. Виртуалкам выделил фиксированную память без ballooning, чтобы избежать нехватки страниц во время инференса. Модель работает 24/7: prefill около 200 ток/с, decode 13–17 ток/с.
Автор отмечает, что для такой модели нужно минимум 64 ГБ RAM: на 32 ГБ она не живёт. Также он предупреждает о проблеме Open WebUI с инструментами — из-за дублирования tool_calls может возникнуть бесконечный цикл, рекомендуется ограничить CHAT_RESPONSE_MAX_TOOL_CALL_ITERATIONS до 2–3.
Для профиТехнические детали: архитектура, цифры, ссылки
Конфигурация: AMD Ryzen AI 9 365 (NPU XDNA2, Radeon 880M), 64 ГБ DDR5–4800, Proxmox VE 9.2 (Debian 13 trixie), ядро 7.0.2–6-pve, драйвер amdxdna в ядре, прошивка NPU 1.1.2.64, XRT libxrt. Модель Qwen3.6–35B-A3B в формате .q4nx весит ~20 ГБ, занимает 21,2 ГБ в пуле NPU. Скорость: prefill ~200 ток/с, decode 13–17 ток/с. Пропускная способность памяти NPU ~60 ГБ/с, iGPU ~125 ГБ/с. Ограничения: NPU обслуживает один запрос за раз, падает с double free при незавершённом запросе, вытесняет большую модель ради embedding-модели. В issue #242 у пользователей с 32 ГБ даже GPT-OSS-20B (~14 ГБ) не влезала стабильно.
Что это значит для России
Автор не смог получить доступ к Ryzen AI Software, в составе которого лежит свежий драйвер NPU, из-за региональных ограничений: требуется регистрация и проверка страны, доступ не был получен из России, Казахстана и Нидерландов. Это создаёт дополнительный барьер для пользователей из этих стран, желающих запустить локальные LLM на NPU. В качестве обходного пути автор использовал драйвер, уже входящий в ядро Proxmox на Linux, что позволило обойтись без регистрации.
Вопросы и ответы
- Сколько оперативной памяти нужно для Qwen3.6–35B на NPU?
- Минимум 64 ГБ, так как NPU видит только половину RAM. На 32 ГБ модель не работает стабильно.
- Какая скорость генерации у Qwen3.6–35B на Ryzen AI 9 365?
- Prefill около 200 ток/с, decode 13–17 ток/с.
- Можно ли запустить NPU в виртуальной машине Proxmox?
- Нет, проброс NPU в ВМ пока не поддерживается. FastFlowLM ставится прямо на хост Proxmox.



