IBM a introduit deux nouveaux modèles dans sa série Granite Speech : Granite Speech 4.1 2B et Granite Speech 4.1 2B-NAR, chacun comportant environ 2 milliards de paramètres. Ces modèles sont disponibles sur Hugging Face sous une licence Apache 2.0. Ils répondent à un défi courant des équipes d'IA en entreprise : équilibrer les exigences computationnelles avec la précision en reconnaissance vocale automatique (ASR). Le modèle Granite Speech 4.1 2B est conçu pour la reconnaissance vocale multilingue et la traduction vocale bidirectionnelle, prenant en charge des langues telles que l'anglais, le français, l'allemand, l'espagnol, le portugais et le japonais. En revanche, la variante 2B-NAR se concentre uniquement sur l'ASR, optimisée pour les applications à faible latence, mais exclut le support du japonais. De plus, un troisième modèle, Granite Speech 4.1 2B-Plus, a été lancé, incluant des fonctionnalités d'attribution de locuteur et de timestamps au niveau des mots. Les deux modèles utilisent une architecture en trois parties comprenant un encodeur vocal, un adaptateur de modalité et un modèle linguistique, avec des différences significatives dans leurs processus de décodage. Le modèle autoregressif génère du texte séquentiellement, tandis que le modèle non-autoregressif adopte une approche bidirectionnelle pour une inférence plus rapide. Les données d'entraînement variaient, le modèle standard utilisant 174 000 heures d'audio, tandis que le modèle NAR était formé sur 130 000 heures. Cette publication souligne l'engagement d'IBM à faire progresser la technologie vocale.
IBM Dévoile les Modèles Granite Speech 4.1 2B : Solutions ASR Avancées
IBM a lancé deux modèles innovants de reconnaissance vocale, Granite Speech 4.1 2B et Granite Speech 4.1 2B-NAR, conçus pour améliorer les capacités de reconnaissance et de traduction automatiques.
