Tencent AI Dévoile Covo-Audio : Un Modèle de Langage de Parole de 7B Paramètres pour des Interactions Audio en Temps Réel

Tencent AI Lab a lancé Covo-Audio, un modèle de langage audio de 7 milliards de paramètres qui intègre le traitement de la parole et la compréhension du langage.

3 min readTechnologie

Tencent AI Lab a introduit Covo-Audio, un modèle de langage audio de grande taille avec 7 milliards de paramètres. Ce modèle innovant est conçu pour fusionner le traitement de la parole avec la compréhension linguistique, lui permettant de gérer des entrées audio continues et de produire des sorties audio au sein d'un cadre unique. L'architecture comprend quatre composants clés : un encodeur audio utilisant Whisper-large-v3 pour sa résistance au bruit, un adaptateur audio qui réduit le débit d'échantillonnage, une base de modèle basée sur Qwen2.5-7B-Base pour traiter les séquences audio et textuelles, et un tokenizer et décodeur de parole qui reconstruit un son de haute qualité. Une avancée significative est la stratégie d'interleaving tri-modal hiérarchique, qui aligne les caractéristiques acoustiques continues avec des tokens de parole discrets et du texte en langage naturel. Cette méthode améliore la capacité du modèle à maintenir la cohérence sémantique. De plus, la stratégie de découplage de l'intelligence vocale permet une personnalisation vocale flexible avec peu de données de synthèse vocale. La variante Covo-Audio-Chat-FD prend en charge la communication duplex intégral, gérant la dynamique conversationnelle avec des tokens spécifiques. Les évaluations de performance indiquent que Covo-Audio excelle dans divers benchmarks, atteignant des scores élevés dans la compréhension musicale et les tâches conversationnelles, démontrant son efficacité dans le raisonnement audio et le dialogue.

Technologie