El equipo de MoonMath AI ha lanzado un núcleo de atención bf16 de código abierto diseñado específicamente para la GPU MI300X de AMD, utilizando HIP en lugar de lenguaje ensamblador. Este núcleo, bajo licencia MIT, ha demostrado un rendimiento superior en comparación con AITER v3 de AMD en todas las formas y modos de redondeo evaluados. El núcleo opera exclusivamente en el MI300X, que forma parte de la arquitectura CDNA3 de AMD.
El mecanismo de atención, crucial para los modelos de transformadores, se ejecuta de manera eficiente a través de este núcleo, que procesa entradas en disposiciones BSHD o BHSD sin necesidad de transposición. Aunque admite varias longitudes de secuencia, no permite el enmascaramiento causal ni el procesamiento por lotes de longitud variable.
Una característica notable de este núcleo es su uso de envolturas de ensamblaje de una instrucción, lo que permite la selección de opcodes mientras el compilador gestiona la asignación de registros. La arquitectura del núcleo emplea ocho olas por bloque y optimiza la colocación de memoria, mejorando significativamente el rendimiento. Los resultados de las pruebas indican que el núcleo de MoonMath logra un aumento medio geométrico de 1.18× sobre AITER v3, demostrando su efectividad en aplicaciones del mundo real como la difusión de video.
