En 2023, l'architecture typique pour la génération augmentée par récupération (RAG) était assez uniforme, s'appuyant fortement sur la famille BERT (y compris BGE et e5) pour la compréhension sémantique, BM25 pour les correspondances exactes, et des cross-encodeurs pour le re-ranking, souvent avec Qdrant comme base de données. Cette configuration a été la norme pendant deux ans, et beaucoup l'utilisent encore. Cependant, un examen plus approfondi des environnements de production des équipes de pointe révèle un changement significatif. La dépendance aux encodeurs traditionnels a diminué, les LLMs finement ajustés prenant le devant de la scène. Le re-ranking est désormais principalement géré par des LLMs, et l'inférence est effectuée à l'aide de SGLang au lieu d'ONNX. Cette transformation nécessite une refonte complète de l'infrastructure de support. Cet article explore ces changements et propose des conseils sur la façon d'adapter votre pile technologique, en particulier si vous opérez dans un domaine de niche dépourvu de jeux de données prêts à l'emploi.
Récupération en 2026 : Transition de RAG des encodeurs aux LLM
Découvrez l'évolution de la génération augmentée par récupération (RAG) des encodeurs traditionnels vers les grands modèles de langage (LLM) et ses implications pour vos projets.
