L'équipe de MoonMath AI a présenté un noyau d'attention bf16 open-source spécifiquement conçu pour le GPU MI300X d'AMD, utilisant HIP plutôt que le langage d'assemblage. Ce noyau, sous licence MIT, a montré des performances supérieures par rapport à AITER v3 d'AMD dans toutes les formes et modes d'arrondi évalués. Le noyau fonctionne exclusivement sur le MI300X, qui fait partie de l'architecture CDNA3 d'AMD.
Le mécanisme d'attention, essentiel aux modèles de transformateurs, est exécuté efficacement par ce noyau, qui traite les entrées en dispositions BSHD ou BHSD sans nécessiter de transposition. Bien qu'il prenne en charge diverses longueurs de séquence, il ne permet pas le masquage causal ni le traitement par lots de longueur variable.
Une caractéristique notable de ce noyau est son utilisation d'enveloppes d'assemblage à une instruction, permettant la sélection d'opcode tout en laissant le compilateur gérer l'allocation des registres. L'architecture du noyau utilise huit vagues par bloc et optimise le placement de la mémoire, améliorant considérablement les performances. Les résultats des benchmarks indiquent que le noyau MoonMath atteint un gain de vitesse moyen géométrique de 1,18× par rapport à AITER v3, démontrant son efficacité dans des applications réelles telles que la diffusion vidéo.
