Los Modelos de Lenguaje de Gran Escala (LLMs) han transformado los sistemas de recomendación al aprovechar sus capacidades generativas para comprender mejor las preferencias de los usuarios. Sin embargo, muchos métodos actuales se centran en objetivos a nivel de tokens, lo que dificulta la optimización de métricas a nivel de lista que realmente reflejan la efectividad de las recomendaciones, como NDCG y equidad. Los métodos Best-of-N (BoN) buscan optimizar directamente estas métricas, pero sus altos costos computacionales a menudo limitan su aplicación práctica. Para abordar estos problemas, el Alineamiento BoN busca incorporar capacidades de búsqueda dentro del modelo. Sin embargo, este enfoque enfrenta dos desafíos significativos: la supervisión indiscriminada, donde las referencias estáticas no pueden evaluar con precisión la calidad de los candidatos más allá de sus límites empíricos, y la disminución del gradiente, donde la señal de supervisión se debilita a medida que el modelo mejora, dificultando la eficiencia de la optimización. Para superar estas limitaciones, presentamos BLADE (Alineación List-wise Bayesiana a través de Estimación Dinámica). BLADE emplea un marco bayesiano que refina continuamente la distribución objetivo al integrar datos históricos con evidencia en tiempo real del rendimiento del modelo. Este mecanismo adaptativo asegura que la retroalimentación de entrenamiento se mantenga relevante y efectiva. Nuestras evaluaciones exhaustivas en tres conjuntos de datos del mundo real muestran que BLADE supera las referencias existentes, logrando mejoras notables en precisión de clasificación y métricas complejas a nivel de lista.
Alineación Bayesiana Innovadora para Mejores Recomendaciones LLM
Este artículo presenta BLADE, un enfoque novedoso para mejorar los sistemas de recomendación utilizando métodos bayesianos.
