AgenticFocus разработала новый пайплайн, который преобразует видео от первого лица в датасеты, необходимые для обучения гуманоидных роботов. В отличие от VLM, для которых доступно множество текстовых данных, VLA и world-action-модели сталкиваются с дефицитом качественных обучающих материалов. Создание новых датасетов для этих моделей требует значительных усилий и ресурсов.
Несмотря на наличие большого количества видео от первого лица, размещенных в открытом доступе, их использование для обучения роботов представляет собой сложную задачу. Видеоматериалы, где люди выполняют различные действия, такие как готовка или спорт, должны быть правильно аннотированы и структурированы для эффективного обучения. Это создает дополнительные вызовы для разработчиков, стремящихся улучшить возможности гуманоидных роботов.
Разработка таких технологий имеет важное значение для будущего Physical AI, поскольку она может значительно ускорить процесс обучения и повысить эффективность гуманоидных роботов. Успешная реализация AgenticFocus может привести к более широкому применению гуманоидных роботов в различных сферах, включая медицину, обслуживание и бытовую помощь.