La recuperación de información (RI) es fundamental para muchas tareas actuales de procesamiento de lenguaje natural (NLP). La llegada de la recuperación densa (RD) ha cambiado el panorama de la RI al utilizar redes neuronales para aprender representaciones vectoriales semánticas, mejorando significativamente la efectividad de la recuperación. Un aspecto clave en la formación de recuperadores densos efectivos es la selección de muestras negativas informativas a través del aprendizaje contrastivo. Este estudio sintetiza hallazgos de 35 trabajos seminales, ofreciendo una visión completa y actualizada de las estrategias de muestreo negativo en la RI densa. Una contribución única de este trabajo es su enfoque en aplicaciones modernas de NLP y la inclusión de métodos recientes impulsados por Modelos de Lenguaje Grande (LLMs), un área poco explorada en revisiones anteriores. Proponemos una taxonomía que clasifica estas técnicas en categorías como muestreo aleatorio, minería estática/dinámica y generación de conjuntos de datos sintéticos. Además, analizamos estos enfoques en función de su efectividad, costo computacional y dificultad de implementación. El estudio concluye destacando los desafíos actuales y las direcciones futuras prometedoras para el uso de datos sintéticos generados por LLM.
Técnicas de muestreo negativo en recuperación de información
Este estudio analiza diversos métodos de muestreo negativo en la recuperación de información densa, destacando su relevancia en aplicaciones modernas de NLP.
