Después de finalizar mi artículo sobre NormIs-1, decidí profundizar en la optimización del modelo. Aunque la arquitectura mostró resultados aceptables en métricas de inteligencia, su velocidad era un problema considerable. El principal culpable era la Convolución Depthwise, que implicaba numerosos accesos a la memoria. Un pequeño bloque de convolución estaba ubicado entre el bloque de atención y la Red de Alimentación Adelante (FFN), causando un cuello de botella en los cálculos. Mi objetivo era mejorar esta área específica. Desarrollar un modelo de lenguaje completo con mecanismos de atención integrales no era factible debido a problemas como el entrenamiento inestable, la pérdida explosiva o un DataLoader defectuoso. En su lugar, opté por un enfoque más simple: una CNN ligera combinada con un núcleo MLX personalizado para inferencia, junto con benchmarks de velocidad para evaluar el rendimiento.
Acelerando Convoluciones: Mi Trayectoria
Explorando la optimización de la arquitectura del modelo para un mejor rendimiento.
