Le Questionnement de Documents (DocQA) fait souvent face à des contextes longs et à une surcharge d'informations, compliquant le raisonnement pour les Modèles Vision-Langage (VLMs). Bien que GraphRAG multimodal ait réalisé des avancées, il rencontre encore des obstacles majeurs : la nécessité de modèles volumineux pour gérer des requêtes de complexité variée et les limites de raisonnement des VLMs traditionnels. Pour surmonter ces défis, nous proposons AutoThinkRAG, un cadre novateur conçu pour améliorer la gestion de documents complexes grâce à la collaboration de plusieurs modèles. Une caractéristique clé est le Routeur de Complexité de Requête, qui dirige les voies de raisonnement en fonction de la complexité des requêtes. De plus, nous proposons une architecture découplée où un VLM compact agit comme un interprète visuel précis, convertissant les informations visuelles pertinentes en texte. Ce texte est ensuite analysé par un modèle de langage plus grand (LLM) pour le raisonnement logique et la synthèse. Nos tests approfondis sur DocBench et MMLongBench montrent qu'AutoThinkRAG réduit non seulement les coûts d'inférence, mais établit également de nouveaux repères en matière de performance. Une analyse supplémentaire confirme l'efficacité de notre approche.
AutoThinkRAG : Contrôle Avancé pour l'Interaction Image-Texte
AutoThinkRAG surmonte les défis du Questionnement de Documents en améliorant les capacités de raisonnement des Modèles Vision-Langage.
