В области извлечения информации традиционные методы ориентированы на возврат релевантных документов по запросам пользователей. Однако многие коллекции документов также содержат чувствительные личные данные, что вызывает опасения по поводу конфиденциальности. Для решения этой проблемы растет интерес к моделям поиска с учетом чувствительности (SAS), которые стремятся предоставлять релевантные результаты, защищая при этом чувствительную информацию. Ключевым ресурсом для разработки таких систем является тестовая коллекция, которая включает как чувствительные, так и нечувствительные данные, а также разнообразные запросы и оценки релевантности. Набор электронных писем Enron служит практическим примером, так как содержит реальные деловые письма, некоторые из которых содержат чувствительное содержание. Однако оригинальный набор данных не содержит формулировок запросов и оценок релевантности. Для решения этой проблемы исследователи собрали 150 формулировок запросов по 50 темам, а также 11 471 оценку релевантности для тщательно выбранного поднабора писем Enron, помеченных по чувствительности. Кроме того, коллекция была расширена с использованием больших языковых моделей (LLMs) для предоставления дополнительных оценок и меток чувствительности. Установлены базовые показатели производительности для релевантности, классификации чувствительности и поиска с учетом чувствительности. Полная коллекция доступна, в том числе через пакет ir_datasets, а также предоставлены предварительно построенные индексы на Huggingface для упрощения экспериментов.
Тестовая коллекция для поиска с учетом чувствительности личной информации
В статье рассматривается создание тестовой коллекции, предназначенной для поиска с учетом чувствительности, акцентируя внимание на балансе между извлечением информации и защитой личной жизни.
