Dans le domaine de la récupération d'informations, les méthodes traditionnelles se concentrent sur le retour de documents pertinents en fonction des requêtes des utilisateurs. Cependant, de nombreuses collections de documents contiennent également des données personnelles sensibles, soulevant des préoccupations en matière de confidentialité. Pour résoudre ce problème, l'accent est mis sur les modèles de recherche sensibles (SAS) qui visent à fournir des résultats pertinents tout en protégeant les informations sensibles. Une ressource clé pour développer ces systèmes est une collection de tests qui inclut à la fois des données sensibles et non sensibles, ainsi qu'une variété de requêtes et d'évaluations de pertinence. Le jeu de données d'emails d'Enron sert d'exemple pratique, contenant de véritables emails commerciaux, dont certains incluent des contenus sensibles. Cependant, le jeu de données original manque de formulations de requêtes et d'évaluations de pertinence. Pour remédier à cela, les chercheurs ont collecté 150 requêtes sur 50 sujets, ainsi que 11 471 évaluations de pertinence pour un sous-ensemble soigneusement sélectionné d'emails d'Enron étiquetés pour leur sensibilité. De plus, la collection a été enrichie à l'aide de modèles de langage (LLMs) pour fournir d'autres évaluations et étiquettes de sensibilité. Des indicateurs de performance de base pour la pertinence, la classification de sensibilité et la recherche sensible ont été établis. La collection complète est accessible, y compris via le package ir_datasets, et des indices préconstruits sont disponibles sur Huggingface pour une expérimentation simplifiée.
Une collection de tests pour la recherche sensible aux informations personnelles
Cet article traite de la création d'une collection de tests conçue pour la recherche sensible, mettant l'accent sur l'équilibre entre la récupération d'informations et la protection de la vie privée.
