Les modèles de langage de grande taille (LLMs) ont révolutionné les systèmes de recommandation en exploitant leurs capacités génératives pour mieux comprendre les préférences des utilisateurs. Cependant, de nombreuses méthodes actuelles se concentrent sur des objectifs au niveau des tokens, rendant difficile l'optimisation des métriques au niveau des listes qui reflètent véritablement l'efficacité des recommandations, telles que NDCG et l'équité. Les méthodes Best-of-N (BoN) visent à optimiser directement ces métriques, mais leurs exigences computationnelles limitent souvent leur application pratique. Pour surmonter ces problèmes, l'alignement BoN cherche à intégrer les capacités de recherche dans le modèle. Cependant, cette approche rencontre deux défis majeurs : la supervision indifférenciée, où les références statiques échouent à évaluer avec précision la qualité des candidats au-delà de leurs limites empiriques, et la décroissance du gradient, où le signal de supervision s'affaiblit à mesure que le modèle s'améliore, entravant l'efficacité de l'optimisation. Nous introduisons donc BLADE (Alignement List-wise Bayésien par Estimation Dynamique). BLADE utilise un cadre bayésien qui affine en continu la distribution cible en intégrant des données historiques avec des preuves en temps réel issues des performances du modèle. Ce mécanisme adaptatif garantit que les retours d'entraînement restent pertinents et efficaces. Nos évaluations approfondies sur trois ensembles de données réelles montrent que BLADE surpasse les références existantes, réalisant des améliorations notables en précision de classement et en métriques complexes au niveau des listes.
Alignement Bayesian Innovant pour Améliorer les Recommandations LLM
Cet article présente BLADE, une approche novatrice pour améliorer les systèmes de recommandation grâce aux méthodes bayésiennes.
