OPERA : Un Cadre pour l'Élagage Efficace des Données dans les Modèles de Récupération

Présentation d'OPERA, un cadre novateur conçu pour améliorer l'adaptation des modèles de récupération grâce à un élagage efficace des données.

3 min readRecherche

Dans le domaine des systèmes de récupération denses, le fine-tuning sur des données spécifiques au domaine est essentiel. Cependant, toutes les paires d'entraînement ne sont pas également bénéfiques pour le processus d'apprentissage. OPERA se présente comme une solution, axée sur l'élagage des données pour optimiser l'efficacité et l'efficacité de l'adaptation des modèles. Le cadre commence par un élagage statique (SP), qui filtre les paires de requêtes-documents à faible similarité. Cette méthode met en évidence un équilibre critique entre qualité et couverture : alors que les performances de classement (NDCG) s'améliorent, l'efficacité de la récupération (Recall) peut souffrir d'un manque de diversité des requêtes. Pour résoudre ce problème, OPERA introduit une approche d'élagage dynamique (DP) qui ajuste les probabilités d'échantillonnage pour les requêtes et les documents pendant l'entraînement. Cela garantit que les exemples de haute qualité sont prioritaires tout en utilisant l'ensemble complet des données d'entraînement. Les évaluations sur huit ensembles de données divers montrent que SP améliore les métriques de classement par rapport au fine-tuning traditionnel (NDCG@10 +0,5 %). En revanche, DP surpasse à la fois les métriques de classement (NDCG@10 +1,9 %) et de récupération (Recall@20 +0,7 %), atteignant un rang moyen de 1,38 parmi les méthodes. De plus, ces résultats sont applicables à Qwen3-Embedding, un récupérateur dense basé sur une architecture LLM, démontrant la polyvalence du cadre. Fait remarquable, DP atteint des résultats similaires en moins de la moitié du temps d'entraînement des méthodes standard.

Recherche