Модели больших языков (LLM) произвели революцию в системах рекомендаций, используя свои генеративные способности для лучшего понимания предпочтений пользователей. Однако многие существующие методы LLM в основном сосредоточены на токен-уровневых целях, что затрудняет оптимизацию метрик на уровне списков, которые действительно отражают качество рекомендаций, таких как NDCG и справедливость. Методы Best-of-N (BoN) стремятся напрямую оптимизировать эти метрики во время рекомендации, но их высокая вычислительная стоимость часто ограничивает практическое применение. Чтобы решить эти проблемы, выравнивание BoN пытается внедрить возможности поиска в саму модель. Тем не менее, этот подход сталкивается с двумя серьезными проблемами: проблема недифференцированной супервайзинга, когда статические ссылки не могут точно оценить качество кандидатов за пределами их эмпирических границ, и затухание градиента, когда сигнал супервайзинга быстро ослабевает по мере улучшения модели, что приводит к неэффективной оптимизации. Чтобы преодолеть эти ограничения, мы предлагаем BLADE (Байесовское Выравнивание на Уровне Списков через Динамическую Оценку). BLADE использует байесовскую структуру, которая постоянно обновляет целевое распределение, объединяя исторические данные с динамическими доказательствами из текущих результатов модели. Этот механизм создает саморазвивающуюся цель, которая адаптируется к растущим возможностям модели, обеспечивая информативность сигнала обучения на протяжении всего процесса обучения. Обширные эксперименты на трех реальных наборах данных показывают, что BLADE значительно превосходит существующие методы, достигая устойчивых улучшений как в точности ранжирования, так и в сложных метриках на уровне списков.
Инновационное Байесовское Выравнивание для Улучшенных Рекомендаций LLM
В этой статье обсуждается BLADE, новый подход к улучшению систем рекомендаций с использованием байесовских методов.
