Le développement d'agents de recherche approfondie nécessite la création de trajectoires étendues combinant recherche, collecte de preuves et raisonnement complexe. Les méthodes de collecte de données traditionnelles dépendent souvent d'API web propriétaires, entraînant des défis en matière d'évolutivité, de stabilité et de reproductibilité. OpenResearcher répond à ces problèmes en fournissant un pipeline entièrement reproductible qui sépare la configuration initiale du corpus de la synthèse des trajectoires multi-tours. Ce système fonctionne entièrement hors ligne, utilisant trois fonctions de navigateur fondamentales : recherche, ouverture et recherche, sur un vaste corpus de 15 millions de documents. En s'appuyant sur le modèle GPT-OSS-120B, OpenResearcher génère avec succès plus de 97 000 trajectoires, dont beaucoup impliquent plus de 100 appels d'outils. Le perfectionnement d'un modèle 30B-A3B sur ces trajectoires a entraîné une augmentation significative de 34 points sur la référence BrowseComp-Plus, atteignant une précision de 54,8 %. La nature hors ligne de l'environnement permet une analyse approfondie, fournissant des informations précieuses sur la conception des pipelines de recherche approfondie. Le pipeline OpenResearcher, ainsi que les trajectoires synthétisées et les points de contrôle du modèle, sont disponibles sur https://github.com/TIGER-AI-Lab/OpenResearcher.
OpenResearcher : Une approche innovante pour le développement de trajectoires de recherche à long terme
OpenResearcher propose une méthode novatrice et reproductible pour synthétiser des trajectoires de recherche à long terme, améliorant l'efficacité des agents de recherche approfondie.
