Проблема разреженной инференции в долгих контекстах заключается в необходимости эффективного извлечения токенов как на этапе предварительного заполнения, так и на этапе декодирования. Традиционные методы часто используют разные стратегии извлечения для каждой стадии, что ограничивает возможность повторного использования представлений извлечения. Чтобы решить эту проблему, мы предлагаем Автоиндексирующее Внимание, структуру, работающую без необходимости в обучении и основанную на единой представлении знака-магнита в преобразовательной области. Этот инновационный подход позволяет создать индекс на уровне токенов, который можно повторно использовать как для группового предварительного заполнения, так и для извлечения на этапе декодирования. Важно отметить, что это представление также совместимо с внешней компрессией KV-cache, что исключает необходимость в отдельных метаданных индексации. Система индексации на 1 бит облегчает эффективное извлечение через побитовые операции, которые хорошо поддерживаются современными ускорителями. Наши оценки показывают, что при плотности внимания 5% Автоиндексирующее Внимание показывает результаты, сопоставимые с плотным вниманием на таких бенчмарках, как LongBench и RULER, достигая впечатляющих ускорений до 6,1 раза для предварительного заполнения и 10,3 раза для декодирования.
Автоиндексирующее Внимание для Эффективной Инференции Разреженных Долгих Контекстов
Представляем новую структуру для улучшения извлечения токенов в разреженной инференции.
