Tilde Research a introduit Aurora, un optimiseur de pointe pour l'entraînement des réseaux de neurones, qui résout efficacement un défaut majeur de l'optimiseur Muon. Ce défaut entraîne un nombre considérable de neurones dans les perceptrons multicouches (MLP) devenant inactifs pendant l'entraînement. Aurora a été validé à travers une expérience de préentraînement impliquant 1,1 milliard de paramètres et a atteint des résultats de pointe sur le benchmark modifié nanoGPT, avec un code open-source disponible.
Pour comprendre l'importance d'Aurora, il est essentiel de d'abord saisir Muon, qui a gagné en popularité dans la communauté de l'apprentissage automatique pour sa performance supérieure par rapport à AdamW en termes de vitesse de convergence. Muon utilise une approche algorithmique unique qui calcule le facteur polaire de la matrice de gradient, permettant des mises à jour de poids efficaces. Cependant, il a été constaté que Muon conduit involontairement à un phénomène où une part substantielle des neurones devient inactive, en particulier dans les matrices de poids hautes.
Aurora corrige ce problème en utilisant un nouveau cadre mathématique qui assure des mises à jour uniformes à travers tous les neurones tout en maintenant les avantages de l'orthogonalisation. L'optimiseur a démontré une efficacité remarquable, atteignant 100 fois l'efficacité des données sur des ensembles de données open-source et surpassant des modèles plus grands dans diverses évaluations, tout en étant un remplacement presque direct pour Muon avec un overhead minimal.
