Виртуальный помощник Алиса прошел через значительные изменения, объединив текстовую и визуальную модели в одну омнимодель. Ранее эти модели работали отдельно, что создавало сложности в восприятии запросов, содержащих как текст, так и изображения. Теперь же пользователи могут получать более согласованные и точные ответы, так как обе модели функционируют в едином контексте.
Процесс интеграции занял почти год и включал в себя множество испытаний и корректировок. Разработчики столкнулись с различиями в форматах ответов и вёрстке, что требовало тщательной работы над роутингом данных между моделями. Несмотря на трудности, команда смогла создать систему, которая значительно улучшает взаимодействие с пользователями, делая его более естественным и интуитивным.
Эта интеграция имеет важное значение для развития технологий искусственного интеллекта, так как она демонстрирует возможности объединения различных подходов в одной модели. Успешное слияние LLM и VLM может стать основой для дальнейших улучшений в области AI, открывая новые горизонты для создания более сложных и адаптивных систем.