En el ámbito de los sistemas de recomendación industriales, la modelización de usuarios suele depender de embeddings densos que están limitados por sus dimensiones fijas. Ha surgido un nuevo enfoque que utiliza modelos de lenguaje de gran tamaño (LLMs) para generar tokens de usuario basados en texto. Aunque este método captura relaciones temáticas, tiene dificultades para vincular estas representaciones a atributos específicos de los artículos. Por otro lado, la tokenización basada en ID semántico (SID) ha demostrado ser efectiva para mejorar las recomendaciones generativas, pero su aplicación a las representaciones de usuarios sigue siendo limitada. TokenMinds busca cerrar esta brecha al ampliar el marco PLUM a la modelización de usuarios, generando tanto tokens de usuario basados en SID como embeddings densos a través de una arquitectura de codificador-decodificador derivada de LLMs preentrenados. Este innovador mecanismo de doble salida permite obtener representaciones de usuarios ricas en semántica mientras se asegura la compatibilidad con modelos existentes que dependen de embeddings densos. Además, el vocabulario SID compartido facilita la modelización interescenario, fusionando de manera efectiva los comportamientos de video largos y cortos en un sistema unificado, lo que reduce significativamente los costos de entrenamiento y operación. Pruebas exhaustivas y aplicaciones en el mundo real en diversas plataformas de YouTube demuestran la efectividad de TokenMinds, confirmando las ventajas complementarias de los tokens de usuario basados en SID junto con embeddings densos en sistemas de clasificación a gran escala.
TokenMinds: Mejora de la Representación de Usuarios en Sistemas de Recomendación
TokenMinds presenta un enfoque innovador para la modelización de usuarios en sistemas de recomendación al combinar tokens de usuario discretos con embeddings densos.
