Пользователь приобрел мини-ПК с процессором Ryzen AI 9 365 для запуска локальной модели на нейронном процессоре (NPU). Начав с Windows, он столкнулся с проблемами, связанными с совместимостью и драйверами, что привело к переходу на Proxmox, где он смог успешно запустить модель Qwen3.6–35B‑A3B через FastFlowLM.
В ходе экспериментов пользователь обнаружил, что NPU может обрабатывать только один запрос за раз, что ограничивает его производительность. Модель демонстрирует скорость prefill около 200 токенов в секунду и decode от 13 до 17 токенов в секунду. Однако, возникли проблемы с падением системы из-за ошибки double free, если клиент не дождался завершения обработки запроса.
Этот опыт подчеркивает как потенциал, так и ограничения современных NPU в контексте локальных LLM. Пользователь продолжает использовать систему 24/7, что свидетельствует о ее работоспособности, несмотря на выявленные недостатки.