Google DeepMind Представляет Decoupled DiLoCo: Новая Асинхронная Архитектура Обучения, Достигающая 88% Полезной Производительности При Высоких Темпах Отказов Оборудования

Google DeepMind представила Decoupled DiLoCo, революционную архитектуру обучения, которая повышает эффективность обучения моделей ИИ, разделяя вычислительные ресурсы и улучшая устойчивость к сбоям.

5 min readТехнологии

Обучение передовым моделям ИИ представляет собой значительные проблемы координации, особенно по мере увеличения масштабов моделей. Традиционное распределенное обучение зависит от синхронизированной связи между множеством чипов, что может привести к задержкам, если какой-либо чип сталкивается с проблемами. Decoupled DiLoCo (Distributed Low-Communication) от Google DeepMind предлагает инновационное решение, создавая асинхронные, изолированные от сбоев 'острова' вычислений, что позволяет более устойчиво проводить обучение в нескольких центрах обработки данных.

Эта архитектура решает ограничения стандартного обучения Data-Parallel, которое требует, чтобы все устройства ждали самое медленное во время обновлений градиентов. Позволяя единицам обучения работать полузависимо и выполнять локальные шаги градиента перед обменом обновлениями, Decoupled DiLoCo значительно снижает требуемую полосу пропускания между центрами обработки данных с 198 Гбит/с до всего 0,84 Гбит/с.

Более того, система демонстрирует впечатляющую устойчивость к сбоям благодаря инженерии хаоса, поддерживая полезную производительность на уровне 88% даже при высоких темпах отказов, по сравнению с всего 27% для традиционных методов. Архитектура была успешно протестирована при обучении модели с 12 миллиардами параметров в четырех регионах США, достигая скорости более чем в 20 раз быстрее, чем традиционные методы. Кроме того, она поддерживает гетерогенное оборудование, позволяя использовать разные поколения чипов в одном обучении, тем самым продлевая срок службы более старой технологии.

Технологии