Изучение Проблем Производительности в Поиске Видео по Тексту

Данное исследование анализирует сложности поиска видео по тексту, акцентируя внимание на производительности моделей и характеристиках наборов данных.

5 min readИсследования

Поиск видео по тексту стал важным инструментом с ростом объема онлайн-видео, позволяя пользователям находить соответствующий контент с помощью запросов на естественном языке. Несмотря на достижения в таких методах, как двойные кодировщики, модели внимания и мультимодальные подходы за последние шесть лет, остаются важные вопросы о поведении моделей, влиянии наборов данных и сложности запросов. В этом исследовании мы оцениваем 14 современных методов поиска по трем широко используемым наборам данных, применяя единый подход к предварительной обработке и оценке. Мы анализируем различные характеристики подписей, включая длину, ясность, семантические категории и баланс между действиями и сценами, связывая эти аспекты с производительностью моделей. Наши результаты показывают, что короткие, ясные и простые подписи, такие как описания отдельных действий или цветовых атрибутов, обеспечивают более высокий уровень поиска, в то время как сложные события и детализированные описания сцен остаются сложными для всех существующих моделей. Архитектуры на основе внимания лучше справляются с временно зависимыми или многошаговыми запросами, в то время как двойные кодировщики и мультимодальные модели хорошо работают в основном с более простыми или однотипными подписями. Кросс-наборная обобщаемость улучшается с увеличением и разнообразием наборов подписей, но генеративные подписи не всегда повышают точность поиска. В целом, наши выводы подчеркивают ключевые факторы наборов данных, проблемы бенчмаркинга и взаимодействие между содержанием запроса и архитектурой модели, предоставляя рекомендации для разработки более эффективных систем поиска видео по тексту.

Исследования