Tencent AI Представляет Covo-Audio: Модель Речевого Языка на 7B Параметров для Взаимодействий в Реальном Времени

Tencent AI Lab выпустил Covo-Audio, модель речевого языка на 7 миллиардов параметров, которая объединяет обработку речи и языковое понимание.

3 min readТехнологии

Tencent AI Lab представил Covo-Audio, крупную модель речевого языка с 7 миллиардами параметров. Эта инновационная модель разработана для объединения обработки речи и языкового понимания, позволяя ей обрабатывать непрерывные аудиовходы и генерировать аудиовыходы в рамках единой структуры. Архитектура состоит из четырех ключевых компонентов: аудиокодировщика, использующего Whisper-large-v3 для устойчивости к шуму, аудиопреобразователя, который уменьшает частоту дискретизации, основы модели на Qwen2.5-7B-Base для обработки чередующихся аудио и текстовых последовательностей, и токенизатора речи и декодера, который восстанавливает высококачественное аудио. Значительным достижением является стратегия иерархического тримодального интерливинга, которая выравнивает непрерывные акустические характеристики с дискретными речевыми токенами и текстом на естественном языке. Этот метод улучшает способность модели поддерживать семантическую согласованность. Кроме того, стратегия декомпозиции интеллектуального говорящего позволяет гибкую настройку голоса с минимальными данными текст-в-речь. Вариант Covo-Audio-Chat-FD поддерживает полудуплексную связь, управляя динамикой разговора с помощью специфических токенов. Оценки производительности показывают, что Covo-Audio превосходит в различных бенчмарках, достигая высоких баллов в понимании музыки и разговорных задачах, демонстрируя свою эффективность в аудиорассуждениях и диалоге.

Технологии