В недавнем сравнении моделей Qwen3.5 и Qwen3.6 в локальном инференсе выяснилось, что новая версия не всегда демонстрирует лучшие результаты. Для анализа было проведено семь квантов через шесть групп тестов, в ходе которых было использовано почти миллиард токенов. Это позволило получить более полное представление о производительности обеих моделей.
Несмотря на ожидания, результаты тестирования показали, что одна из моделей не соответствовала заявленным характеристикам. Это подчеркивает важность тщательной проверки новых технологий перед их внедрением. Вопросы о том, почему некоторые пользователи продолжают использовать старую модель, остаются актуальными, особенно в свете полученных данных.
Данное исследование поднимает важные вопросы о надежности новых моделей и необходимости их тестирования в реальных условиях. Оно также напоминает о том, что не всегда стоит спешить с переходом на новые решения, так как старые версии могут оказаться более эффективными в определенных сценариях.