В области плотных систем поиска тонкая настройка на данных, специфичных для домена, имеет решающее значение. Однако не все пары для обучения одинаково полезны для процесса обучения. OPERA выступает в качестве решения, сосредоточенного на обрезке данных для оптимизации как эффективности, так и результативности адаптации модели. Рамка начинается с статической обрезки (SP), которая фильтрует пары запрос-документ с низким уровнем сходства. Этот метод подчеркивает критический баланс между качеством и охватом: в то время как производительность ранжирования (NDCG) улучшается, эффективность поиска (Recall) может пострадать из-за нехватки разнообразия запросов. Чтобы решить эту проблему, OPERA вводит динамическую обрезку (DP), которая настраивает вероятности выборки для запросов и документов в процессе обучения. Это обеспечивает приоритет высококачественным примерам при использовании полного набора данных для обучения. Оценки на восьми различных наборах данных показывают, что SP улучшает метрики ранжирования по сравнению с традиционной тонкой настройкой (NDCG@10 +0,5%). В отличие от этого, DP превосходит как метрики ранжирования (NDCG@10 +1,9%), так и поиска (Recall@20 +0,7%), достигая среднего ранга 1,38 среди методов. Более того, эти результаты применимы к Qwen3-Embedding, плотному поисковику на основе архитектуры LLM, что демонстрирует универсальность рамки. Примечательно, что DP достигает сопоставимых результатов за менее чем половину времени обучения, необходимого для стандартных методов.
OPERA: Рамки для Эффективной Обрезки Данных в Моделях Поиска
Представляем OPERA, инновационную рамку, разработанную для улучшения адаптации моделей поиска через эффективную обрезку данных.
