L'entraînement de modèles d'IA avancés présente des défis de coordination importants, surtout à mesure que l'échelle des modèles augmente. L'entraînement distribué traditionnel repose sur une communication synchronisée entre de nombreuses puces, ce qui peut entraîner des retards si une puce rencontre des problèmes. Decoupled DiLoCo (Distributed Low-Communication) de Google DeepMind propose une solution novatrice en créant des 'îlots' de calcul asynchrones et isolés des pannes, permettant un entraînement plus résilient à travers plusieurs centres de données.
Cette architecture répond aux limites de l'entraînement Data-Parallel standard, qui nécessite que tous les appareils attendent le plus lent lors des mises à jour des gradients. En permettant aux unités d'apprentissage d'opérer semi-indépendamment et d'effectuer des étapes de gradient locales avant de partager des mises à jour, Decoupled DiLoCo réduit considérablement la bande passante inter-centres de données requise de 198 Gbps à seulement 0,84 Gbps.
De plus, le système démontre une tolérance aux pannes impressionnante grâce à l'ingénierie de chaos, maintenant un bon rendement de 88% même sous de forts taux de pannes, contre seulement 27% pour les méthodes traditionnelles. Le cadre a été testé avec succès en entraînant un modèle de 12 milliards de paramètres à travers quatre régions des États-Unis, atteignant des vitesses plus de 20 fois plus rapides que les méthodes conventionnelles. En outre, il prend en charge le matériel hétérogène, permettant l'utilisation de différentes générations de puces au sein d'un même entraînement, prolongeant ainsi la durée de vie de la technologie plus ancienne.
