Attention Auto-Indexante pour une Inférence Efficace en Contexte Long Sparse

Présentation d'un cadre novateur pour améliorer la récupération de tokens dans l'inférence sparse.

3 min readRecherche

Le défi de l'inférence en contexte long sparse réside dans la nécessité d'une récupération efficace des tokens durant les phases de préremplissage et de décodage. Les méthodes traditionnelles utilisent souvent des approches de récupération distinctes pour chaque phase, limitant ainsi la réutilisation des représentations de récupération. Pour remédier à cela, nous proposons l'Attention Auto-Indexante, un cadre qui fonctionne sans nécessiter d'entraînement et repose sur une représentation sign-magnitude unifiée dans le domaine de la transformation. Cette approche innovante permet de créer un index au niveau des tokens pouvant être réutilisé pour la sélection de préremplissage groupé et la récupération de décodage. De plus, cette représentation est compatible avec la compression de KV-cache externe, éliminant le besoin de métadonnées d'indexation séparées. Le système d'indexation à 1 bit facilite la récupération efficace via des opérations bit à bit, bien prises en charge par les accélérateurs modernes. Nos évaluations montrent qu'à une densité d'attention de 5 %, l'Attention Auto-Indexante se compare à l'attention dense sur des benchmarks tels que LongBench et RULER, atteignant des gains de vitesse impressionnants allant jusqu'à 6,1 fois pour le préremplissage et 10,3 fois pour les opérations de décodage.

Recherche