En el ámbito de los sistemas de recuperación densos, el ajuste fino con datos específicos del dominio es fundamental. Sin embargo, no todas las parejas de entrenamiento son igualmente beneficiosas para el proceso de aprendizaje. OPERA surge como una solución, centrada en la poda de datos para optimizar tanto la eficiencia como la efectividad de la adaptación del modelo. El marco comienza con la poda estática (SP), que filtra las parejas de consulta-documento de baja similitud. Este método destaca un equilibrio crítico entre calidad y cobertura: mientras que el rendimiento de clasificación (NDCG) mejora, la efectividad de recuperación (Recall) puede verse afectada por la falta de diversidad en las consultas. Para abordar este problema, OPERA introduce un enfoque de poda dinámica (DP) que ajusta las probabilidades de muestreo para consultas y documentos durante el entrenamiento. Esto asegura que se prioricen ejemplos de alta calidad mientras se utiliza el conjunto completo de datos de entrenamiento. Las evaluaciones en ocho conjuntos de datos diversos indican que SP mejora las métricas de clasificación en comparación con el ajuste fino tradicional (NDCG@10 +0.5%). En contraste, DP supera tanto las métricas de clasificación (NDCG@10 +1.9%) como las de recuperación (Recall@20 +0.7%), logrando un rango promedio de 1.38 entre los métodos. Además, estos resultados son aplicables a Qwen3-Embedding, un recuperador denso basado en arquitectura LLM, demostrando la versatilidad del marco. Notablemente, DP alcanza resultados comparables en menos de la mitad del tiempo de entrenamiento requerido por los métodos estándar.
OPERA: Un Marco para la Poda Eficiente de Datos en Modelos de Recuperación
Presentamos OPERA, un marco innovador diseñado para mejorar la adaptación de modelos de recuperación a través de la poda eficiente de datos.
