La recuperación texto-vídeo se ha vuelto esencial a medida que aumenta el contenido de video en línea, permitiendo a los usuarios localizar videos relevantes a través de consultas en lenguaje natural. A pesar de los avances en técnicas como codificadores duales, modelos de atención y enfoques multimodales en los últimos seis años, persisten preguntas importantes sobre el comportamiento de los modelos, la influencia de los conjuntos de datos y la dificultad de las consultas. En esta investigación, evaluamos 14 métodos de recuperación de vanguardia en tres conjuntos de datos ampliamente utilizados, aplicando un marco de preprocesamiento y evaluación unificado. Analizamos diversas características de los subtítulos, incluyendo longitud, claridad, categoría semántica y el equilibrio entre acción y escena, vinculando estos aspectos al rendimiento del modelo. Nuestros resultados muestran que los subtítulos cortos, claros y simples, como aquellos que describen acciones únicas o atributos de color, logran una mayor recuperación, mientras que eventos complejos y descripciones de escenas detalladas siguen siendo desafiantes para todos los modelos existentes. Las arquitecturas basadas en atención manejan mejor las consultas temporales o de múltiples pasos, mientras que los modelos de codificadores duales y fusión multimodal funcionan bien principalmente con subtítulos más simples o de una sola categoría. La generalización entre conjuntos de datos mejora con conjuntos de subtítulos más grandes y diversos, pero los subtítulos generativos no siempre mejoran la precisión de recuperación. En general, nuestros hallazgos destacan factores clave de los conjuntos de datos, desafíos de referencia y la interacción entre el contenido de la consulta y la arquitectura del modelo, proporcionando orientación para desarrollar sistemas de recuperación texto-vídeo más efectivos.
Explorando los Desafíos del Rendimiento en la Recuperación Texto-Vídeo
Este estudio investiga las complejidades de la recuperación texto-vídeo, centrándose en el rendimiento del modelo y las características del conjunto de datos.
