На этой неделе Google анонсировал запуск функции Agentic Video Understanding для моделей Gemini Flash, которая кардинально меняет подход к обработке видео. Ранее модели обрабатывали видео, фиксируя его на одном кадре в секунду, что требовало значительных ресурсов. Теперь Gemini может выбирать, что именно смотреть, и в каком темпе, что позволяет сократить количество токенов на 88% и снизить затраты на 66%.
Новая функция уже доступна в виде хостируемого API через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform. Это значит, что разработчики смогут интегрировать Agentic Video Understanding в свои приложения, однако открытых весов для самостоятельного хостинга не предусмотрено.
Внедрение этой технологии может значительно улучшить качество взаимодействия с видео-контентом, предоставляя более точные и экономичные решения для обработки. Это особенно важно в условиях растущего объема видеоинформации и потребности в эффективных инструментах для ее анализа.