Информационный поиск (ИП) играет ключевую роль во многих современных задачах обработки естественного языка (NLP). Появление плотного поиска (ПП) изменило ИП, используя нейронные сети для обучения семантическим векторным представлениям, что значительно улучшило эффективность поиска. Ключевым аспектом обучения надежных плотных поисковиков является выбор информативных негативных образцов через контрастное обучение. Этот обзор обобщает данные из 35 влиятельных исследований, предлагая всесторонний и актуальный анализ техник негативного отбора в плотном ИП. Уникальной особенностью данной работы является акцент на современных приложениях NLP и включение недавних методов, основанных на больших языковых моделях (LLM), которые не были широко рассмотрены в предыдущих обзорах. Мы предлагаем таксономию, которая классифицирует эти техники на такие категории, как случайный отбор, статическая/динамическая добыча и генерация синтетических наборов данных. Кроме того, мы анализируем эти подходы с точки зрения их эффективности, вычислительных затрат и сложности реализации. Обзор завершается описанием текущих проблем и перспективных направлений использования синтетических данных, генерируемых LLM.
Техники негативного отбора в информационном поиске
Этот обзор исследует различные методы негативного отбора в плотном информационном поиске, подчеркивая их значимость в современных приложениях NLP.
