IBM представила две новые модели в своей серии Granite Speech: Granite Speech 4.1 2B и Granite Speech 4.1 2B-NAR, каждая из которых содержит около 2 миллиардов параметров. Эти модели доступны на Hugging Face под лицензией Apache 2.0. Они решают общую задачу, с которой сталкиваются команды ИИ в бизнесе: сбалансировать вычислительные требования с точностью в автоматическом распознавании речи (ASR). Модель Granite Speech 4.1 2B предназначена для многоязычного ASR и двунаправленного перевода речи, поддерживая такие языки, как английский, французский, немецкий, испанский, португальский и японский. В отличие от этого, вариант 2B-NAR сосредоточен исключительно на ASR, оптимизированном для приложений с низкой задержкой, но не поддерживает японский. Кроме того, был выпущен третий вариант, Granite Speech 4.1 2B-Plus, который включает функции атрибуции говорящего и временные метки на уровне слов. Обе модели используют трехкомпонентную архитектуру, состоящую из кодировщика речи, адаптера модальности и языковой модели, с существенными различиями в их процессах декодирования. Автогрессивная модель генерирует текст последовательно, в то время как неавтогрессивная модель использует двунаправленный подход для более быстрой инференции. Данные для обучения различались: стандартная модель использовала 174 000 часов аудио, в то время как модель NAR была обучена на 130 000 часов. Этот релиз подчеркивает приверженность IBM к продвижению технологий распознавания речи.
IBM Представляет Модели Granite Speech 4.1 2B: Продвинутые Решения ASR
IBM выпустила две инновационные модели распознавания речи, Granite Speech 4.1 2B и Granite Speech 4.1 2B-NAR, предназначенные для улучшения возможностей автоматического распознавания и перевода речи.
