Alibaba Qwen3.8‑LiveTranslate presenta una interpretación simultánea en tiempo real de audio y vídeo para reuniones, llamadas entre idiomas y subtítulos en vivo. Interweave el audio, las imágenes de vídeo, el texto original y el texto traducido dentro de una misma secuencia temporal, y genera traducción de manera continua mientras el hablante aún no ha terminado. La información oficial afirma que su latencia media adaptativa se redujo de 2,8 segundos en la generación anterior a 2,3 segundos, una caída de aproximadamente 18%. El modelo puede recibir audio en 60 idiomas y emitir el texto correspondiente; de esos, 29 idiomas también pueden sintetizarse en voz. Las capacidades añadidas incluyen: distinguir múltiples locutores, conservar por separado el timbre de cada locutor, mostrar sincronizados el texto original y la traducción, y eliminar ambigüedades de nombres, términos y homófonos mediante el uso de diálogos históricos y las imágenes. Sin embargo, 2,3 segundos es un indicador de la evaluación LAAL, no la latencia extremo a extremo completa desde que el sonido entra en el micrófono hasta que el usuario escucha la traducción. Además, la empresa no ha publicado el número de parámetros, pesos del modelo, el cómputo de entrenamiento, ni la composición de los datos de entrenamiento, ni resultados completos por idioma, ni un proceso de reproducción independiente. Por el momento, el acceso se ofrece principalmente mediante la API en la nube.

Autor del artículo, fuente: Qwen

Lo que quiere resolver no es solo “traducir la voz a otro idioma”.

Los sistemas tradicionales de traducción en tiempo real normalmente se pueden dividir en tres etapas: primero convertir voz en texto, luego realizar la traducción automática, y finalmente convertir el texto traducido en voz. Este enfoque en cadena es fácil de desplegar, pero agrega tiempo de espera y errores en cada etapa: si el reconocimiento se equivoca en un nombre, la etapa de traducción puede amplificar el error; si hay varios locutores alternándose, el sistema también puede no distinguir a quién pertenece cada frase, y la voz sintetizada finalmente pierde las características de la voz del hablante original.

Qwen3.8‑LiveTranslate intenta integrar estas tareas en un sistema continuo de flujo. Utiliza un diseño de doble módulo Thinker–Talker basado en un modelo de mezcla de expertos.

Thinker se encarga de entrelazar, en una misma secuencia causal en orden temporal, las imágenes de vídeo, el audio que está llegando, el texto en el idioma fuente y la traducción que ya se ha generado. El modelo no necesita volver a leer toda la conversación completa en cada franja temporal; puede reutilizar el audio ya escuchado y la caché de traducciones ya producidas.

Talker genera la voz en el idioma objetivo a partir de la traducción y del audio fuente, e intenta conservar el timbre del hablante original. En otras palabras, el sistema no intenta solo transmitir “qué se dijo”, sino también “quién lo dijo”.

2,3 segundos no es la latencia de una solicitud de red

La cifra más llamativa en este lanzamiento es la de LAAL: bajó de 2,8 segundos a 2,3 segundos.

LAAL significa Length-Adaptive Average Lagging, es decir, latencia media promedio adaptativa a la longitud. Mide cuánto tiempo, en promedio, el modelo se queda atrás al generar la traducción con respecto al contenido del idioma fuente, y corrige el sesgo de evaluación cuando la traducción es demasiado larga. Refleja mejor si toda la interpretación simultánea se mantiene al ritmo del hablante durante todo el tramo, en comparación con registrar solo cuándo aparece el primer token de traducción.

Por lo tanto, 2,3 segundos no es una latencia fija “desde que el usuario habla hasta que escucha el primer tramo de voz”, ni incluye todas las etapas: grabación del cliente, transmisión de red, cola en el servidor y el búfer de reproducción de audio. La experiencia real también dependerá de la ubicación en la red, la calidad del audio de entrada, el idioma objetivo, si se genera voz y la velocidad de habla.

Aun así, la cifra sigue teniendo sentido: según el criterio oficial, la latencia media se acortó en unos 0,5 segundos, con una caída de aproximadamente 18%. Para reuniones y transmisiones en vivo que requieren escuchar continuamente la traducción, una reducción estable de medio segundo suele ser más importante que poder sacar ocasionalmente el primer término extremadamente rápido.

Las reuniones con múltiples participantes son el foco de esta generación

Qwen3.8‑LiveTranslate añade la capacidad de separación en tiempo real de locutores. Cuando varios participantes hablan por turnos, el sistema determina a qué locutor pertenecen las distintas frases y conserva la identidad correspondiente en el texto de salida. Al generar la voz en el idioma objetivo, también intenta replicar el timbre de cada persona por separado.

Esta capacidad se aplica a entrevistas, mesas redondas y conferencias internacionales. Incluso si el sistema tradicional de interpretación simultánea con traducción consecutiva es correcto, puede convertir todas las intervenciones en una sola voz, dificultando que el público identifique la relación entre las preguntas y las respuestas. Qwen busca que el audio traducido mantenga la estructura de “quién responde a quién”.

Pero la información oficial solo muestra con claridad intervenciones alternadas de varios locutores, y no ha publicado tasas de error detalladas en escenarios como varios locutores hablando a la vez, ruido de fondo intenso, captación a larga distancia ni voces con alta similitud. La llamada “conservación del timbre” tampoco equivale a una replicación completa de emociones, tono y ritmo del habla.

En el ejemplo de API, los desarrolladores pueden activar, dentro de una misma sesión WebSocket, el reconocimiento del idioma de origen, las marcas de locutor, el texto de la traducción y la voz sintetizada, sin necesidad de iniciar una solicitud por cada resultado. El ejemplo de entrada usa PCM mono a 16 kHz, y la voz sintetizada es PCM a 24 kHz.

La imagen y el diálogo histórico también participan en la traducción

La traducción puramente por voz suele enfrentarse a ambigüedades que el simple modo de pronunciación no puede resolver. Por ejemplo, si una persona pronuncia un nombre o topónimo homófono, los subtítulos, las diapositivas, el texto en el empaque del producto o las palabras dentro de la imagen podrían ser la evidencia clave que determina la traducción correcta.

Qwen3.8‑LiveTranslate permite que el cliente envíe tramas de imagen además del flujo de audio, usando la información visual como contexto de la traducción. La demostración oficial usa ejemplos de diálogo de (Viaje al Oeste) y de homófonos para mostrar cómo la imagen ayuda a juzgar el significado de las palabras.

El modelo también utilizará conversaciones históricas más largas para mantener la coherencia terminológica. Si un nombre, proyecto o producto ya aparece en el texto anterior, las referencias y siglas posteriores pueden basarse en la traducción previa, en lugar de tener que adivinarlas de nuevo en cada frase.

Esto la hace más adecuada para reuniones continuas y no solo para traducir una locución de forma independiente. Sin embargo, la empresa aún no ha explicado cuánto tiempo de contexto puede cubrir de manera estable, ni ha mostrado memoria a largo plazo entre reuniones; en cambio, la memoria entre sesiones se lista como una línea de trabajo futura.

“Soportar 60 idiomas” debe entenderse desglosado

El modelo puede recibir audio en 60 idiomas y producir texto traducido. El alcance incluye, además de idiomas comunes como chino, inglés, japonés, coreano, francés y español, también cantonés, bengalí, suajili, kazajo, kirguís y malabar, entre otros.

Pero la salida de voz solo cubre 29 idiomas de ese conjunto. Por tanto, “soporta 60 idiomas” no significa que todas las combinaciones lingüísticas puedan ofrecer interpretación simultánea de voz conservando el timbre; algunos idiomas solo pueden emitir texto.

La información oficial evaluó 70 direcciones de traducción en el conjunto de pruebas de audio FLEURS, examinando la calidad de la traducción, LAAL, la exactitud del reconocimiento de voz y la calidad de la síntesis de voz, y afirma que el nuevo modelo supera a la generación anterior y a varios sistemas principales de interpretación simultánea en tiempo real.

Otra prueba de Omnilingua‑MSpeaker cubre 14 direcciones de traducción de audio largo con múltiples participantes. Las métricas incluyen fidelidad, fluidez, concisión y la tasa de error de separación de locutores. La información oficial también reporta que el nuevo modelo supera globalmente al anterior.

Estos resultados todavía pertenecen a pruebas internas del fabricante. La información oficial no ha publicado simultáneamente los valores completos por idioma, los intervalos de confianza, los detalles de la evaluación humana y las salidas originales; además, el mundo exterior aún no ha completado reproducciones independientes. Por lo tanto, no se puede concluir solo a partir de las gráficas resumen que el modelo sea líder en todas las combinaciones de acentos, dominios e idiomas.

Actualmente es un servicio en la nube, no un modelo abierto descargable

Aunque la serie Qwen suele publicar modelos con pesos abiertos, en esta ocasión Qwen3.8‑LiveTranslate no ha publicado pesos descargables ni ha dado el total de parámetros, parámetros activados, el cómputo de entrenamiento o la composición de los datos de entrenamiento. Por ahora, se puede usar mediante la interfaz de WebSocket en tiempo real de QwenCloud y DashScope.

Los precios publicados en la página del modelo para la versión internacional son: entrada de audio 7,5 USD por cada millón de tokens; entrada de imagen 0,55 USD; salida de texto 20 USD; salida de voz 30 USD. El total de contexto es de 53K tokens, con un límite de entrada de 49K y un límite de salida de 4K.

La tasa de conversión entre tokens de audio y minutos reales no se proporciona en la página del modelo; por tanto, no se puede calcular con precisión “cuánto cuesta una reunión de una hora” solo con esos precios. La entrada por voz y la salida por voz también se facturan al mismo tiempo, y en escenarios de vídeo puede haber tokens de imagen.

La implementación en la nube también implica que el audio de la reunión, las imágenes y los datos que podrían usarse para clonar el timbre deben enviarse al servidor. En esta entrada técnica del blog no se discutieron en detalle cuestiones como la retención de datos, las autorizaciones para clonar el timbre, el uso de marcas de agua y la forma de despliegue privado para empresas. Estas serán preguntas que deberán verificarse aparte cuando se adopte en reuniones médicas, legales y empresariales.

El verdadero avance es pasar de “traducir oraciones” a “traducir una conversación”.

Lo más destacable de Qwen3.8‑LiveTranslate no es simplemente añadir decenas de idiomas más, sino ampliar el objetivo de la traducción en tiempo real: pasar de la precisión en oraciones a abarcar todo el proceso de comunicación. Mantiene una latencia baja, identifica a distintos locutores, conserva la identidad de la voz, muestra el texto original de forma sincronizada y utiliza la imagen y el contexto histórico para mantener la coherencia terminológica.

Aún no ha demostrado que pueda reemplazar a los intérpretes profesionales. Los traductores profesionales manejan metáforas, contexto cultural, estrategias de intervención e intenciones no expresadas con claridad; el modelo actual tampoco ha publicado evaluaciones completas sobre interrupciones repentinas, ruido intenso, acentos marcados y escenarios diplomáticos o médicos de alto riesgo.

Pero la ruta técnica ya está bastante clara: el próximo producto de traducción ya no será solo “reconocimiento de voz + traducción automática”, sino que irá convirtiéndose en una capa multimodal de comunicación continua que percibe personas, voces, imágenes y contexto.