Tencent AI Presenta Covo-Audio: Un Modelo de Lenguaje de Voz de 7B Parámetros para Interacciones de Audio en Tiempo Real

Tencent AI Lab ha lanzado Covo-Audio, un modelo de lenguaje de audio de 7 mil millones de parámetros que integra el procesamiento de voz y la comprensión del lenguaje.

3 min readTecnología

Tencent AI Lab ha introducido Covo-Audio, un modelo de lenguaje de gran tamaño con 7 mil millones de parámetros. Este modelo innovador está diseñado para fusionar el procesamiento de voz con la comprensión del lenguaje, permitiéndole manejar entradas de audio continuas y generar salidas de audio dentro de un marco único. La arquitectura consta de cuatro componentes clave: un codificador de audio que utiliza Whisper-large-v3 por su resistencia al ruido, un adaptador de audio que reduce la tasa de muestreo, una base de modelo basada en Qwen2.5-7B-Base para procesar secuencias de audio y texto, y un tokenizador y decodificador de voz que reconstruye audio de alta calidad. Un avance significativo es la estrategia de intercalado tri-modal jerárquico, que alinea características acústicas continuas con tokens de voz discretos y texto en lenguaje natural. Este método mejora la capacidad del modelo para mantener la coherencia semántica. Además, la estrategia de desacoplamiento del hablante inteligente permite una personalización de voz flexible con datos mínimos de texto a voz. La variante Covo-Audio-Chat-FD admite comunicación de duplex completo, gestionando dinámicas conversacionales con tokens específicos. Las evaluaciones de rendimiento indican que Covo-Audio sobresale en varios benchmarks, alcanzando puntajes altos en comprensión musical y tareas conversacionales, demostrando su eficacia en razonamiento de audio y diálogo.

Tecnología