El preentrenamiento de modelos de lenguaje grandes (LLM) es un proceso costoso, y pequeñas mejoras en la eficiencia pueden resultar en ahorros significativos. Nous Research ha presentado el Entrenamiento por Superposición de Tokens (TST), un método innovador que acelera el preentrenamiento sin alterar la estructura del modelo, el optimizador, el tokenizer o los datos. En la escala de 10B-A1B, TST logró una pérdida de entrenamiento final más baja que una línea base comparable, utilizando solo 4,768 horas GPU B200 en comparación con 12,311, lo que representa una reducción de 2.5x en el tiempo de preentrenamiento. TST opera en dos fases: la primera fase, Superposición, agrupa los tokens en bolsas, permitiendo que el modelo procese más texto por unidad de cómputo. La segunda fase, Recuperación, regresa a la predicción estándar de tokens. Los experimentos en varios tamaños de modelos demostraron que TST superó consistentemente los métodos tradicionales en términos de eficiencia y rendimiento.
Nous Research Lanza Entrenamiento por Superposición de Tokens para Acelerar el Preentrenamiento de LLM
El Entrenamiento por Superposición de Tokens (TST) reduce significativamente el tiempo de preentrenamiento de modelos de lenguaje sin modificar su arquitectura.
