AutoThinkRAG: Control Avanzado para la Interacción Imagen-Texto

AutoThinkRAG aborda los desafíos del Cuestionamiento de Documentos al mejorar las capacidades de razonamiento en Modelos de Visión-Lenguaje.

3 min readTecnología

El Cuestionamiento de Documentos (DocQA) a menudo enfrenta dificultades debido a contextos largos y sobrecarga de información, lo que complica el razonamiento en los Modelos de Visión-Lenguaje (VLMs). Aunque GraphRAG multimodal ha logrado algunos avances, todavía enfrenta obstáculos significativos: la necesidad de modelos grandes para manejar consultas de diversas complejidades y las limitaciones de razonamiento de los VLMs tradicionales. Para abordar estos desafíos, presentamos AutoThinkRAG, un marco innovador diseñado para mejorar el manejo de documentos complejos mediante la colaboración de múltiples modelos. Una característica clave es el Enrutador de Complejidad de Consulta, que dirige las rutas de razonamiento según la complejidad de las consultas. Además, proponemos una arquitectura desacoplada donde un VLM compacto actúa como un intérprete visual preciso, convirtiendo la información visual relevante en texto. Este texto es luego analizado por un modelo de lenguaje más grande (LLM) para el razonamiento lógico y la síntesis. Nuestros extensos experimentos en DocBench y MMLongBench demuestran que AutoThinkRAG no solo reduce los costos de inferencia, sino que también establece nuevos estándares de rendimiento. Estudios adicionales confirman la efectividad de nuestro enfoque.

Tecnología