Atención Auto-Indexante para Inferencia Eficiente en Contextos Largos Sparse

Presentamos un nuevo marco para mejorar la recuperación de tokens en la inferencia sparse.

3 min readInvestigación

El desafío de la inferencia en contextos largos sparse radica en la necesidad de una recuperación efectiva de tokens durante las fases de prellenado y decodificación. Los métodos existentes a menudo utilizan estrategias de recuperación diferentes para cada fase, lo que limita la reutilización de las representaciones de recuperación. Para abordar esto, proponemos la Atención Auto-Indexante, un marco que funciona sin necesidad de entrenamiento y se basa en una representación unificada de signo-magnitud en el dominio de la transformación. Este enfoque innovador permite crear un índice a nivel de token que se puede reutilizar tanto para la selección de prellenado agrupado como para la recuperación de decodificación. Además, esta representación es compatible con la compresión de KV-cache externa, eliminando la necesidad de metadatos de indexación separados. El sistema de indexación de 1 bit facilita la recuperación eficiente a través de operaciones a nivel de bits, bien soportadas por los aceleradores modernos. Nuestros estudios muestran que con una densidad de atención del 5%, la Atención Auto-Indexante se mantiene cerca de la atención densa en benchmarks como LongBench y RULER, logrando aumentos de velocidad de hasta 6.1 veces para el prellenado y 10.3 veces para las operaciones de decodificación.

Investigación