Investing.com02:52Федеральная резервная система США планирует дальнейшие повышения процентных ставокInvesting.com02:36Председатель ФРС Логан призывает к повышению ставок на 50 базисных пунктов и болееPhys.org00:40Новый метод генерации почти неразличимых фотонов для квантовой связиFast Company00:30Университет Вермонта исследует применение цифровых двойников в медицинеOilPrice23:40Китай приостанавливает экспорт топлива в октябре на фоне глобального дефицита дизеляFortune20:54Paramount и Warner Bros. завершили сделку на $111 миллиардов с обязательством выпускать 30 фильмов в годCarscoops20:30GM и LG Energy приближаются к производству новых батарейCryptoPotato19:59Evernorth получает одобрение акционеров для выхода на Nasdaq с XRPArs Technica19:28Искусственный интеллект Ataraxos одержал победу в игре StrategoOilPrice19:00Историческая сделка по сверхпроводникам приближает коммерческое использование термоядерного синтеза

vestka

Опыт использования мини-ПК с NPU для локальной LLM

Пользователь приобрел мини-ПК с процессором Ryzen AI 9 365 для запуска локальной модели на нейронном процессоре (NPU). Начав с Windows, он столкнулся с проблемами, связанными с совместимостью и драйверами, что привело к переходу на Proxmox, где он смог успешно запустить модель Qwen3.6–35B‑A3B через FastFlowLM.

В ходе экспериментов пользователь обнаружил, что NPU может обрабатывать только один запрос за раз, что ограничивает его производительность. Модель демонстрирует скорость prefill около 200 токенов в секунду и decode от 13 до 17 токенов в секунду. Однако, возникли проблемы с падением системы из-за ошибки double free, если клиент не дождался завершения обработки запроса.

Этот опыт подчеркивает как потенциал, так и ограничения современных NPU в контексте локальных LLM. Пользователь продолжает использовать систему 24/7, что свидетельствует о ее работоспособности, несмотря на выявленные недостатки.

Главное

  • Мини-ПК оснащен процессором Ryzen AI 9 365.
  • Скорость prefill составляет около 200 токенов в секунду.
  • Скорость decode варьируется от 13 до 17 токенов в секунду.
  • NPU может обрабатывать только один запрос за раз.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →