OpenSanctions Pairs : Avancées dans l'Appariement d'Entités avec les LLM

OpenSanctions Pairs propose un vaste benchmark pour l'appariement d'entités, utilisant des modèles de langage avancés pour améliorer les flux de travail de conformité.

4 min readTechnologie

Le jeu de données OpenSanctions Pairs représente une avancée majeure dans l'appariement d'entités en fournissant un benchmark complet dérivé de données réelles sur les sanctions internationales. Ce jeu de données comprend 755 540 paires étiquetées provenant de 293 sources diverses dans 31 pays, avec des noms multilingues et interscripts, ainsi que des attributs pouvant être bruyants ou incomplets. L'étude évalue un système d'appariement basé sur des règles, en particulier l'algorithme nomenklatura RegressionV1, par rapport à divers modèles de langage (LLMs) dans des contextes zero-shot et few-shot. Les résultats montrent que les LLMs surpassent de manière significative l'approche basée sur des règles, atteignant des scores F1 allant jusqu'à 98,95 % avec GPT-4o et 98,23 % avec un modèle open-source, DeepSeek-R1-Distill-Qwen-14B. Bien que l'optimisation de prompt DSPy MIPROv2 entraîne des améliorations constantes, l'inclusion d'exemples en contexte n'améliore pas les performances et peut même les nuire. Une analyse des erreurs indique que le système basé sur des règles a tendance à sur-apparier, entraînant un nombre élevé de faux positifs, tandis que les LLMs rencontrent principalement des difficultés avec la translittération interscript et des incohérences mineures dans les identifiants et les dates. Ces résultats suggèrent que le domaine atteint un plafond de performance en matière d'appariement par paires, soulignant la nécessité de se concentrer sur d'autres composants du pipeline d'appariement, tels que le blocage et le regroupement.

Technologie