Après avoir terminé mon article sur NormIs-1, j'ai décidé d'explorer plus en profondeur l'optimisation du modèle. Bien que l'architecture ait montré des résultats raisonnables en termes de métriques d'intelligence, sa vitesse était un problème majeur. Le principal responsable était la convolution depthwise, qui impliquait de nombreux accès à la mémoire. Un petit bloc de convolution était placé entre le bloc d'attention et le réseau de neurones à propagation avant (FFN), ce qui causait un goulot d'étranglement dans les calculs. Mon objectif était d'améliorer cette zone spécifique. Développer un modèle linguistique complet avec des mécanismes d'attention complets n'était pas réalisable en raison de problèmes tels que l'apprentissage instable, la perte explosive ou un DataLoader défectueux. J'ai donc opté pour une approche plus simple : une CNN légère combinée à un noyau MLX personnalisé pour l'inférence, accompagnée de benchmarks de vitesse pour évaluer la performance.
Accélérer les Convolutions : Mon Parcours
Exploration de l'optimisation de l'architecture du modèle pour de meilleures performances.
