В недавнем сравнении производительности моделей на графической карте RTX PRO 6000 был протестирован 2-битный вариант DeepSeek V4 Flash. Результаты показали, что производительность составила 0.697 балла, что на 0.034 балла ниже, чем у модели с полной точностью, которая достигла 0.731 балла.
В предыдущей серии автор уже сравнивал производительность Qwen3.8-27B с DeepSeek V4 Flash по API, что вызвало интерес у читателей к возможностям использования DeepSeek на той же карте с уменьшенной точностью. Это исследование поднимает важный вопрос о реальной цене квантования и влиянии шума на результаты.
Данные результаты могут быть значимыми для разработчиков и исследователей в области искусственного интеллекта, стремящихся оптимизировать модели для использования на ограниченных ресурсах. Понимание компромиссов между точностью и производительностью при квантовании может помочь в дальнейшем развитии технологий ИИ.