La récupération de vidéos à partir de grands ensembles de données est souvent compliquée par des requêtes utilisateur vagues, que les méthodes traditionnelles à un seul tour peinent à traiter. Ces méthodes rencontrent des limites en raison de leur incapacité à intégrer des mécanismes de rétroaction efficaces, ce qui conduit à ce que l'on appelle le 'Gap Intent-Requête.' Ce gap se produit lorsque l'intention réelle d'un utilisateur n'est pas correctement représentée par une simple requête textuelle. Pour résoudre ce problème, nous présentons le cadre ADEPT, un agent innovant qui fonctionne sans besoin de formation préalable. ADEPT utilise un processus décisionnel basé sur l'entropie qui navigue habilement dans le dialogue en alternant entre deux stratégies : DEMANDER et AFFINER. Grâce à des tests rigoureux sur deux ensembles de données exigeants, ADEPT a montré des améliorations remarquables par rapport aux approches non interactives, heuristiques et Video-LLM existantes. L'accomplissement principal de cette recherche réside dans l'établissement d'une stratégie interactive claire et efficace qui améliore l'interprétabilité et fixe une nouvelle norme de performance dans le domaine de la récupération vidéo interactive.
ADEPT : Une Nouvelle Approche pour la Récupération Vidéo Interactive
ADEPT propose une méthode révolutionnaire pour améliorer la récupération vidéo à partir de vastes ensembles de données en abordant les ambiguïtés des requêtes utilisateur.
