Nous Research Представляет Обучение по Суперпозиции Токенов для Ускорения Предобучения LLM

Обучение по Суперпозиции Токенов (TST) значительно сокращает время предобучения больших языковых моделей без изменения их архитектуры.

3 min readТехнологии

Предобучение больших языковых моделей (LLM) является дорогостоящим процессом, и даже небольшие улучшения в эффективности могут привести к значительной экономии. Nous Research представила Обучение по Суперпозиции Токенов (TST), новый подход, который ускоряет предобучение, сохраняя при этом существующую структуру модели, оптимизатор, токенизатор и данные. На уровне 10B-A1B TST достигла финальной потери обучения ниже, чем у сопоставимого базового уровня, используя всего 4,768 часов GPU B200 по сравнению с 12,311, что представляет собой сокращение времени предобучения в 2,5 раза. TST работает в два этапа: первый этап, Суперпозиция, включает группировку токенов в пакеты, что позволяет модели обрабатывать больше текста на единицу вычислений. Второй этап, Восстановление, возвращается к стандартному предсказанию токенов. Эксперименты на различных размерах моделей показали, что TST последовательно превосходит традиционные методы по эффективности и производительности.

Технологии