Gradium ha lanzado dos modelos avanzados para la traducción de voz en tiempo real: stt-translate, que convierte voz a texto, y s2s-translate, que traduce audio hablado directamente a otro idioma. Estos modelos admiten cinco idiomas—inglés, francés, alemán, español y portugués—y facilitan 20 pares de traducción de idiomas, simplificando el proceso en un solo paso. Gradium afirma que sus modelos superan a competidores como gpt-realtime-translate y gemini-3.5-live-translate en términos de precisión y latencia. El modelo stt-translate integra transcripción y traducción en una sola operación, eliminando la necesidad de un transcript intermedio. Este diseño mejora la velocidad y la eficiencia. El modelo s2s-translate se basa en esto al proporcionar salida de audio sintetizado junto con transcripciones traducidas, todo a través de una única conexión WebSocket. Gradium mide la calidad de la traducción utilizando métricas BLEU y MetricX, mostrando un rendimiento superior en ambas categorías. La latencia promedio para s2s-translate es de aproximadamente 3.0 segundos, lo que lo hace competitivo en el mercado. Los casos de uso de estos modelos incluyen doblaje en vivo, soporte al cliente multilingüe y traducciones de reuniones en tiempo real, mostrando su versatilidad y efectividad en diversas aplicaciones.
Gradium Lanza Modelos de Traducción de Voz en Tiempo Real
Gradium ha presentado dos modelos innovadores de traducción de voz en tiempo real, stt-translate y s2s-translate, afirmando tener una precisión superior y menor latencia en comparación con soluciones existentes.
