Una colección de pruebas para la búsqueda consciente de la sensibilidad en información personal

Este artículo aborda la creación de una colección de pruebas diseñada para la búsqueda consciente de la sensibilidad, enfocándose en el equilibrio entre la recuperación de información y la privacidad personal.

4 min readInvestigación

En el ámbito de la recuperación de información, los métodos tradicionales se centran en devolver documentos relevantes según las consultas de los usuarios. Sin embargo, muchas colecciones de documentos también contienen datos personales sensibles, lo que genera preocupaciones sobre la privacidad. Para abordar este problema, hay un creciente interés en los modelos de búsqueda consciente de la sensibilidad (SAS) que buscan ofrecer resultados relevantes mientras protegen la información sensible. Un recurso clave para desarrollar estos sistemas es una colección de pruebas que incluya tanto datos sensibles como no sensibles, junto con una variedad de consultas y evaluaciones de relevancia. El conjunto de correos electrónicos de Enron sirve como un ejemplo práctico, ya que contiene correos comerciales reales, algunos de los cuales incluyen contenido sensible. Sin embargo, el conjunto original carece de formulaciones de consultas y evaluaciones de relevancia. Para remediar esto, los investigadores han crowdsourced 150 formulaciones de consultas para 50 temas, junto con 11,471 evaluaciones de relevancia para un subconjunto cuidadosamente seleccionado de correos de Enron etiquetados por sensibilidad. Además, la colección se ha ampliado utilizando modelos de lenguaje (LLMs) para proporcionar evaluaciones y etiquetas de sensibilidad adicionales. Se han establecido métricas de rendimiento base para la relevancia, la clasificación de sensibilidad y la búsqueda consciente de la sensibilidad. La colección completa está disponible, incluyendo a través del paquete ir_datasets, y se proporcionan índices preconstruidos en Huggingface para facilitar la experimentación.

Investigación