Gradium Lance des Modèles de Traduction de Discours en Temps Réel

Gradium a présenté deux modèles innovants de traduction de discours en temps réel, stt-translate et s2s-translate, affirmant une précision supérieure et une latence réduite par rapport aux solutions existantes.

3 min readTechnologie

Gradium a lancé deux modèles de pointe pour la traduction de discours en temps réel : stt-translate, qui convertit la parole en texte, et s2s-translate, qui traduit directement l'audio parlé dans une autre langue. Ces modèles prennent en charge cinq langues—anglais, français, allemand, espagnol et portugais—et facilitent 20 traductions de paires de langues, rationalisant le processus en une seule étape. Gradium affirme que ses modèles surpassent des concurrents comme gpt-realtime-translate et gemini-3.5-live-translate en termes de précision et de latence. Le modèle stt-translate intègre transcription et traduction en une seule opération fluide, éliminant le besoin d'un transcript intermédiaire. Ce choix de conception améliore la vitesse et l'efficacité. Le modèle s2s-translate s'appuie sur cela en fournissant une sortie audio synthétisée accompagnée de transcriptions traduites, le tout via une seule connexion WebSocket. Gradium mesure la qualité de la traduction à l'aide des métriques BLEU et MetricX, ses modèles montrant une performance supérieure dans les deux catégories. La latence moyenne pour s2s-translate est d'environ 3,0 secondes, ce qui le rend compétitif sur le marché. Les cas d'utilisation de ces modèles incluent le doublage en direct, le support client multilingue et les traductions de réunions en temps réel, démontrant leur polyvalence et leur efficacité dans diverses applications.

Technologie