La recuperación de videos de grandes conjuntos de datos a menudo se complica debido a consultas de usuario vagas, que los métodos tradicionales de recuperación de una sola ronda luchan por manejar. Estas técnicas suelen enfrentar limitaciones por su incapacidad para incorporar mecanismos de retroalimentación efectivos, lo que resulta en lo que se denomina la 'Brecha de Intención-Consulta.' Esta brecha surge cuando la verdadera intención de un usuario no se representa adecuadamente con una consulta de texto simple. Para abordar este desafío, presentamos el marco ADEPT, un agente innovador que opera sin necesidad de entrenamiento previo. ADEPT utiliza un proceso de toma de decisiones impulsado por la entropía que navega dinámicamente el diálogo alternando entre dos estrategias: PREGUNTAR y REFINAR. A través de pruebas rigurosas en dos conjuntos de datos desafiantes, ADEPT ha demostrado mejoras significativas en comparación con enfoques no interactivos, heurísticos y Video-LLM. La principal contribución de esta investigación radica en establecer una estrategia interactiva eficiente y clara que mejora la interpretabilidad y establece un nuevo estándar de rendimiento en el campo de la recuperación interactiva de videos.
ADEPT: Un Nuevo Enfoque para la Recuperación Interactiva de Videos
ADEPT presenta un método innovador para mejorar la recuperación de videos de grandes conjuntos de datos al abordar las ambigüedades en las consultas de los usuarios.
