Google Research представила ИИ-координатора для создания длинных видео, который использует четыре агентных фреймворка. Эти фреймворки позволяют превращать короткие клипы в последовательные, многоминутные истории, что является важным шагом в решении проблем, связанных с семантическим дрейфом и каскадными ошибками, которые часто возникают в современных ИИ-видео системах.
Согласно команде Google, большинство существующих ИИ-пайплайнов сталкиваются с трудностями при объединении клипов в целостные истории. Проблемы возникают из-за независимых модулей и ручных подсказок, что приводит к несоответствиям в одежде или окружении между кадрами. Новый подход рассматривает это как проблему распределения кредитов, где сложно отследить, какая подсказка вызвала сбой в конечном видео.
Система работает на основе моделей Gemini и Veo и является независимой от конкретных генераторов. Это позволяет использовать один и тот же уровень для управления различными генераторами, а выходные данные наследуют водяные знаки SynthID от базовых моделей, что обеспечивает дополнительный уровень контроля за качеством создаваемого контента.