Techniques d'échantillonnage négatif en récupération d'information

Cette enquête explore diverses méthodes d'échantillonnage négatif en récupération d'information dense, soulignant leur importance dans les applications modernes de NLP.

5 min readRecherche

La récupération d'information (RI) est essentielle dans de nombreuses tâches contemporaines de traitement du langage naturel (NLP). L'émergence de la récupération dense (RD) a révolutionné la RI en utilisant des réseaux neuronaux pour créer des représentations vectorielles sémantiques, améliorant ainsi l'efficacité des récupérations. Un élément clé pour former des récupérateurs denses performants est la sélection d'échantillons négatifs informatifs via l'apprentissage contrastif. Cette enquête synthétise les résultats de 35 études influentes, offrant une analyse complète et actuelle des stratégies d'échantillonnage négatif en RI dense. Une caractéristique distinctive de ce travail est son accent sur les applications modernes de NLP et l'inclusion de méthodes récentes basées sur des modèles de langage de grande taille (LLMs), peu abordées dans les revues précédentes. Nous proposons un système de classification qui organise ces techniques en catégories telles que l'échantillonnage aléatoire, le minage statique et dynamique, et la génération de jeux de données synthétiques. De plus, nous évaluons ces méthodes en fonction de leur efficacité, de leur coût computationnel et de leur facilité d'implémentation. L'enquête se termine en soulignant les défis actuels et en explorant des pistes prometteuses pour l'utilisation de données synthétiques générées par des LLM à l'avenir.

Recherche