A medida que los agentes LLM dependen cada vez más de las habilidades recuperadas en tiempo real, la selección de habilidades adecuadas de grandes bases de datos se ha convertido en un desafío crítico. Esta investigación presenta un sistema de enrutamiento de habilidades que abarca más de 34,000 habilidades y examina la efectividad de la recuperación de habilidades utilizando supervisión real limitada y datos sintéticos. Los hallazgos indican que, aunque el ajuste fino con datos sintéticos mejora la precisión de recuperación dentro de la distribución de entrenamiento, también provoca un olvido catastrófico de habilidades fuera de esta distribución. Para abordar este problema, se evaluaron varias estrategias inspiradas en el aprendizaje continuo, incluyendo la regularización de anclaje de embedding, el Aprendizaje sin Olvido (LwF), la Consolidación de Pesos Elásticos (EWC) y la inicialización L2. La evaluación reveló que estos métodos no solo preservaron el rendimiento en la recuperación de habilidades fuera de distribución, sino que también aumentaron la precisión de recuperación de habilidades sintéticas en distribución en casi un 14 % para un modelo de recuperador específico. Esta investigación ofrece valiosas perspectivas y un marco práctico para el ajuste fino de modelos con supervisión limitada.
Los Peligros de los Datos Sintéticos: Olvido Catastrófico en la Recuperación de Habilidades de LLM
Este estudio aborda los desafíos de la recuperación de habilidades en agentes LLM y los efectos adversos de los datos sintéticos en el rendimiento.
