IBM Presenta los Modelos Granite Speech 4.1 2B: Soluciones Avanzadas de ASR

IBM ha lanzado dos modelos innovadores de reconocimiento de voz, Granite Speech 4.1 2B y Granite Speech 4.1 2B-NAR, diseñados para mejorar las capacidades de reconocimiento y traducción automática.

4 min readTecnología

IBM ha introducido dos nuevos modelos en su serie Granite Speech: Granite Speech 4.1 2B y Granite Speech 4.1 2B-NAR, ambos con aproximadamente 2 mil millones de parámetros. Estos modelos están disponibles en Hugging Face bajo una licencia Apache 2.0. Abordan un desafío común que enfrentan los equipos de IA empresarial: equilibrar las demandas computacionales con la precisión en el reconocimiento automático de voz (ASR). El modelo Granite Speech 4.1 2B está diseñado para el ASR multilingüe y la traducción de voz bidireccional, cubriendo idiomas como inglés, francés, alemán, español, portugués y japonés. En contraste, la variante 2B-NAR se centra exclusivamente en el ASR, optimizando para aplicaciones de baja latencia, pero excluyendo el soporte para japonés. Además, se ha lanzado un tercer modelo, Granite Speech 4.1 2B-Plus, que incluye características para la atribución de hablantes y marcas de tiempo a nivel de palabra. Ambos modelos utilizan una arquitectura de tres partes que incluye un codificador de voz, un adaptador de modalidad y un modelo de lenguaje, con diferencias significativas en sus procesos de decodificación. El modelo autoregresivo genera texto de manera secuencial, mientras que el modelo no autoregresivo emplea un enfoque bidireccional para una inferencia más rápida. Los datos de entrenamiento variaron, con el modelo estándar utilizando 174,000 horas de audio, mientras que el modelo NAR se entrenó con 130,000 horas. Este lanzamiento destaca el compromiso de IBM con el avance de la tecnología de voz.

Tecnología