Команда MoonMath AI представила открытое ядро внимания bf16, специально разработанное для GPU MI300X от AMD, использующее HIP вместо ассемблера. Это ядро, лицензированное под MIT, продемонстрировало превосходство в производительности по сравнению с AITER v3 от AMD во всех оцененных формах и режимах округления. Ядро работает исключительно на MI300X, который является частью архитектуры CDNA3 от AMD.
Механизм внимания, ключевой для моделей трансформеров, эффективно выполняется через это ядро, которое обрабатывает входные данные в раскладках BSHD или BHSD без необходимости транспонирования. Хотя оно поддерживает различные длины последовательностей, оно не допускает причинного маскирования или пакетной обработки переменной длины.
Замечательной особенностью этого ядра является использование оберток ассемблера с одной инструкцией, что позволяет выбирать опкоды, в то время как компилятор управляет выделением регистров. Архитектура ядра использует восемь волн на блок и оптимизирует размещение памяти, значительно улучшая производительность. Результаты бенчмарков показывают, что ядро MoonMath достигает среднегеометрического ускорения 1,18× по сравнению с AITER v3, демонстрируя свою эффективность в реальных приложениях, таких как видеодиффузия.
