Статья на arXiv под названием "TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision" представляет обновленную версию TAPe+ML v3, которая достигает выдающихся результатов в области компьютерного зрения. Модель демонстрирует 88,1% Top-1 точности на ImageNet-1k, а также 65,3 mAP50–95 в задаче детекции на COCO и 58,4 Mask mAP50–95 в сегментации.
Контекст исследования включает применение TAPe+ML v3 в задачах классификации, индексации и поиска сцен в видео, а также в промышленном OOD-пилоте. Модель была разработана с акцентом на компактность, что позволяет ей эффективно работать с ограниченными вычислительными ресурсами, что является значительным достижением в области многозадачного компьютерного зрения.
Данная работа подчеркивает важность разработки моделей, которые могут достигать высоких результатов при минимальных затратах ресурсов. Это открывает новые возможности для применения компьютерного зрения в реальных условиях, где ресурсы могут быть ограничены, и способствует дальнейшему развитию технологий в этой области.