В последние годы технологии детекции объектов, такие как VLM (Vision Language Model), становятся все более популярными. Однако, как показывает практика, они могут вызывать ложные тревоги, что особенно заметно в задачах детекции дыма и огня. В одном из экспериментов автор обнаружила, что модель ошибочно определяла дым на 70% чистых данных, включая изображения автомобилей и дорожных знаков, что подчеркивает важность корректной настройки промптов.
Автор статьи также описывает, как стандартные методы промпт-инжиниринга не смогли решить проблему ложных тревог. В процессе работы над задачей были выявлены недостатки одношагового bbox-формата, который может способствовать возникновению ошибок. Это поднимает вопросы о необходимости дальнейших исследований и улучшений в алгоритмах детекции, особенно в контексте их применения в реальных условиях.
Проблема ложных тревог в детекции объектов имеет серьезные последствия для безопасности, особенно в ситуациях, связанных с пожарной безопасностью. Улучшение точности моделей может помочь избежать ненужных тревог и повысить эффективность реагирования на реальные угрозы. Это исследование подчеркивает необходимость более глубокого анализа и доработки существующих технологий в области искусственного интеллекта.