Вопросный Ответ по Документам (DocQA) часто сталкивается с трудностями из-за длинных контекстов и избытка информации, что усложняет процесс рассуждения для Моделей Визуализации-Языка (VLMs). Хотя многомодальный GraphRAG достиг некоторых успехов, он по-прежнему сталкивается с серьезными препятствиями: необходимость в крупных моделях для обработки запросов различной сложности и ограничения рассуждения традиционных VLMs. Чтобы решить эти проблемы, мы представляем AutoThinkRAG, новую структуру, предназначенную для улучшения обработки сложных документов с помощью сотрудничества нескольких моделей. Ключевой особенностью является Маршрутизатор Сложности Запроса, который направляет пути рассуждения в зависимости от сложности запросов. Кроме того, мы предлагаем декомпозированную архитектуру, где компактный VLM выступает в роли точного визуального интерпретатора, преобразующего соответствующую визуальную информацию в текст. Этот текст затем анализируется более крупной языковой моделью (LLM) для логического рассуждения и синтеза. Наши обширные эксперименты на DocBench и MMLongBench показывают, что AutoThinkRAG не только снижает затраты на вывод, но и устанавливает новые стандарты производительности. Дополнительные исследования подтверждают эффективность нашего подхода.
AutoThinkRAG: Продвинутый Контроль для Взаимодействия Изображение-Текст
AutoThinkRAG решает проблемы Вопросного Ответа по Документам, улучшая способности рассуждения в Моделях Визуализации-Языка.
