Nous Research Présente l'Entraînement par Superposition de Tokens pour Améliorer l'Efficacité de l'Entraînement des LLM

L'Entraînement par Superposition de Tokens (TST) permet de réduire considérablement le temps d'entraînement des grands modèles de langage sans modifier leur architecture.

3 min readTechnologie

L'entraînement des grands modèles de langage (LLM) est coûteux, et même de légères améliorations d'efficacité peuvent entraîner des économies significatives. Nous Research a introduit l'Entraînement par Superposition de Tokens (TST), une méthode innovante qui accélère l'entraînement tout en préservant la structure du modèle, l'optimiseur, le tokenizer et les données. À l'échelle de 10B-A1B, TST a atteint une perte d'entraînement finale inférieure à celle d'une base comparable, nécessitant seulement 4 768 heures GPU B200 contre 12 311, soit une réduction de 2,5x du temps d'entraînement. TST fonctionne en deux phases : la première phase, Superposition, regroupe les tokens en sacs, permettant au modèle de traiter plus de texte par unité de calcul. La seconde phase, Récupération, revient à la prédiction standard des tokens. Des expériences sur divers modèles ont montré que TST surpassait systématiquement les méthodes traditionnelles en termes d'efficacité et de performance.

Technologie