Explorer les Défis de la Performance en Récupération Texte-Vidéo

Cette étude examine les complexités de la récupération texte-vidéo, en se concentrant sur la performance des modèles et les caractéristiques des ensembles de données.

5 min readRecherche

La récupération texte-vidéo est devenue essentielle avec l'augmentation du contenu vidéo en ligne, permettant aux utilisateurs de trouver des vidéos pertinentes via des requêtes en langage naturel. Malgré les progrès réalisés dans des techniques telles que les encodeurs doubles, les modèles d'attention et les approches multimodales au cours des six dernières années, des questions importantes subsistent concernant la performance des modèles, l'impact des ensembles de données et la complexité des requêtes. Dans cette recherche, nous évaluons 14 techniques de récupération de pointe sur trois ensembles de données notables, en appliquant une stratégie de prétraitement et d'évaluation cohérente. Nous examinons divers aspects des légendes, y compris leur longueur, leur clarté, leurs catégories sémantiques et l'équilibre entre les actions et les scènes, en corrélant ces facteurs avec l'efficacité des modèles. Nos résultats montrent que des légendes concises et simples, en particulier celles décrivant des actions uniques ou des couleurs, donnent de meilleurs résultats de récupération. En revanche, des événements plus complexes et des descriptions de scènes détaillées posent des défis pour les modèles actuels. Les architectures basées sur l'attention excellent avec des requêtes temporellement complexes, tandis que les modèles d'encodeurs doubles et multimodaux sont plus efficaces avec des légendes simples. De plus, la performance inter-ensembles s'améliore avec des collections de légendes plus grandes et plus variées, bien que les légendes génératives ne conduisent pas toujours à de meilleurs résultats de récupération. Cette recherche souligne des considérations critiques concernant les ensembles de données, les problèmes de référence et la relation entre les types de requêtes et les structures des modèles, offrant des perspectives pour améliorer les systèmes de récupération texte-vidéo.

Recherche