Perplexity Research опубликовала результаты нового пост-тренировочного исследования, в котором обучается модель на реальных пользовательских сессиях, включая неудачные. Метод сочетает дообучение с использованием отборного семплирования и самодистилляцию с подсказками. В ходе A/B тестирования было зафиксировано снижение числа сбоев при вызове инструментов с 2.24% до 1.77%, что соответствует статистически значимому снижению на 21.2%.
Несмотря на успешные результаты, Perplexity не планирует сразу же делать модель доступной для широкой публики. Пост-тренировочные веса и код обучения не были опубликованы, и модель функционирует только как опция внутри Perplexity Computer. Базовая модель, GLM 5.2, доступна на платформе Hugging Face, что позволяет исследователям и разработчикам использовать её в своих проектах.
Данный подход к обучению является важным шагом в развитии технологий искусственного интеллекта, так как он позволяет улучшить качество работы моделей, обучая их на реальных ошибках. Это может привести к более надежным системам, способным лучше справляться с разнообразными задачами и ситуациями, что особенно актуально в условиях постоянно меняющегося мира.