В области промышленных рекомендательных систем традиционное моделирование пользователей часто основывается на плотных встраиваниях, которые ограничены фиксированными размерами. Появился новый подход, использующий большие языковые модели (LLMs) для создания текстовых токенов пользователей. Хотя этот метод захватывает тематические связи, он испытывает трудности с привязкой этих представлений к конкретным атрибутам предметов. С другой стороны, токенизация на основе семантического идентификатора (SID) показала свою эффективность в улучшении генеративных рекомендаций, но ее применение к представлениям пользователей остается ограниченным. TokenMinds стремится устранить этот разрыв, расширяя рамки PLUM для моделирования пользователей, генерируя как дискретные токены пользователей на основе SID, так и плотные встраивания через архитектуру кодировщика-декодера, основанную на предобученных LLM. Этот инновационный механизм с двойным выходом позволяет получать семантически насыщенные представления пользователей, обеспечивая совместимость с существующими моделями, которые зависят от плотных встраиваний. Кроме того, общий словарь SID облегчает межсценарное моделирование, эффективно объединяя поведение длинных и коротких видео в единую систему, что значительно снижает затраты на обучение и эксплуатацию. Обширные оффлайн-тесты и реальные приложения на различных платформах YouTube демонстрируют эффективность TokenMinds, подтверждая дополнительные преимущества токенов пользователей на основе SID наряду с плотными встраиваниями в масштабируемых системах ранжирования.
TokenMinds: Улучшение Представления Пользователей в Рекомендательных Системах
TokenMinds предлагает новый подход к моделированию пользователей в рекомендательных системах, сочетая дискретные токены пользователей с плотными встраиваниями.
