Alibaba Qwên a publié Qwen3.8‑LiveTranslate, un modèle de traduction simultanée temps réel audio-vidéo conçu pour les réunions, les appels multilingues et les sous-titres live. Il entrelace l’audio, l’image vidéo, le texte source et la traduction dans une même séquence temporelle, et génère la traduction tant que la personne parle encore. D’après l’official, la longueur s’adapte et la latence moyenne, par rapport à la génération précédente (2,8 secondes), passe à 2,3 secondes, soit une baisse d’environ 18 %. Le modèle peut recevoir 60 langues et produire le texte correspondant ; parmi elles, 29 langues peuvent en plus être synthétisées en voix. Les nouvelles capacités incluent la distinction de plusieurs intervenants, la conservation séparée du timbre de chaque locuteur, un affichage synchronisé du texte source et du texte traduit, ainsi que l’utilisation du dialogue historique et de l’image pour éliminer les ambiguïtés liées aux noms, aux termes et aux homophones. Cependant, 2,3 secondes correspondent à un indicateur de l’évaluation LAAL, et ne représentent pas une latence de bout en bout complète entre le moment où le son entre au microphone et le moment où l’utilisateur entend la traduction. L’official n’a pas non plus publié le nombre de paramètres, les poids du modèle, la puissance de calcul d’entraînement, les données d’entraînement, les performances complètes par langue, ni des résultats de reproduction indépendante. Pour l’instant, l’accès se fait principalement via une API cloud.
Auteur de l’article, source : Qwen
Ce qu’il cherche à résoudre, ce n’est pas seulement « traduire la voix dans une autre langue »
Les systèmes de traduction temps réel traditionnels peuvent généralement être décomposés en trois étapes : d’abord, transformer la voix en texte via la reconnaissance vocale ; ensuite, réaliser la traduction automatique du texte ; enfin, convertir la traduction en voix. Cette approche en pipeline est facile à déployer, mais elle ajoute à chaque étape du temps d’attente et des erreurs : si, à l’étape de reconnaissance, un nom est mal entendu, l’erreur peut se propager et s’amplifier à l’étape de traduction ; en cas d’alternance de plusieurs locuteurs, le système peut aussi ne pas réussir à distinguer à qui appartient chaque phrase, et la synthèse vocale perd alors les caractéristiques vocales du locuteur original.
Qwen3.8‑LiveTranslate tente de regrouper ces tâches dans un système continu en flux. Il adopte une conception à double module Thinker–Talker basée sur un modèle de mélange d’experts.
Thinker est responsable d’entrelacer, dans une même séquence causale ordonnée par le temps, l’image vidéo, l’audio en train d’arriver, le texte en langue source et la traduction déjà générée. Le modèle n’a pas besoin de relire l’intégralité du dialogue à chaque instant ; il peut réutiliser l’audio déjà entendu et le cache de traductions déjà produites.
Talker génère la voix de la langue cible à partir de la traduction et de l’audio source, tout en conservant autant que possible le timbre du locuteur initial. Autrement dit, le système vise à transmettre non seulement « ce qui a été dit », mais aussi « qui l’a dit ».
2,3 secondes ne sont pas une latence de requête réseau
Le chiffre le plus marquant de cette publication est celui de l’évaluation LAAL, passé de 2,8 secondes à 2,3 secondes.
LAAL signifie Length-Adaptive Average Lagging, soit latence moyenne adaptative en fonction de la longueur. Elle mesure, lorsque le modèle génère la traduction, de combien de temps en moyenne la traduction est en retard par rapport au contenu en langue source, puis corrige les biais d’évaluation causés par une traduction trop longue. Elle reflète mieux si la traduction simultanée suit constamment le locuteur sur l’ensemble de l’interprétation, plutôt que de ne mesurer que le moment où apparaît le premier token de traduction.
Ainsi, 2,3 secondes ne correspond pas à une latence fixe que le simple utilisateur subirait de l’instant où il parle jusqu’au moment où il entend le premier extrait sonore, et cela n’inclut pas non plus l’enregistrement côté client, la transmission réseau, l’attente côté serveur ni la mise en file d’attente/buffer audio. L’expérience réelle dépendra également de la position réseau, de la qualité de l’audio d’entrée, de la langue cible, du fait de générer ou non de la voix, et du rythme de parole.
Ce chiffre garde toutefois son importance : selon la formulation officielle, la latence moyenne a été réduite d’environ 0,5 seconde, soit une baisse d’environ 18 %. Pour les réunions et les directs qui nécessitent d’écouter en continu la traduction, une stabilité avec une avance réduite d’environ une demi-seconde est généralement plus importante qu’une sortie occasionnellement extrêmement rapide du premier mot.
Les réunions multi-locuteurs sont le point clé de cette génération
Qwen3.8‑LiveTranslate ajoute une capacité de séparation des locuteurs en temps réel. Lorsqu’il y a des tours de parole entre plusieurs intervenants, le système détermine à quel locuteur correspondent différentes phrases, conserve l’identité correspondante dans la sortie texte, et lors de la génération de la voix de la langue cible, tente aussi de reproduire le timbre de chacun.
Cette capacité s’applique aux entretiens, aux tables rondes et aux conférences internationales. Même si le système de traduction simultanée classique est correct sur le plan linguistique, il peut fusionner toutes les interventions en une seule voix, rendant difficile pour le public de distinguer la structure du dialogue. Qwen souhaite que l’audio traduit conserve la structure « qui répond à qui ».
Mais l’official n’a montré clairement que des cas d’alternance de plusieurs locuteurs, sans publier de taux d’erreur détaillé dans des scénarios où plusieurs personnes parlent en même temps, avec un bruit de fond fort, une captation à distance ou des voix très semblables. La prétendue « conservation du timbre » ne signifie pas non plus reproduction complète de l’émotion, de l’intonation et du rythme de parole.
Dans l’exemple d’API, les développeurs peuvent activer la reconnaissance de la langue source, l’identification des locuteurs, le texte de la traduction et la synthèse vocale dans une même session WebSocket, sans avoir à lancer une requête séparée pour chaque résultat. L’exemple d’entrée utilise un PCM mono 16 kHz, et la voix synthétisée est un PCM 24 kHz.
L’image et le dialogue historique participent aussi à la traduction
La traduction purement vocale rencontre souvent des ambiguïtés que la prononciation seule ne permet pas de résoudre. Par exemple, quand une personne prononce un nom ou un lieu homophonique, ce sont souvent les sous-titres, le texte d’une présentation, le texte sur l’emballage d’un produit ou les caractères présents dans l’image qui constituent la preuve déterminante pour choisir la bonne traduction.
Qwen3.8‑LiveTranslate permet au client d’envoyer des images sous forme de trames en plus du flux audio, et d’utiliser l’information visuelle comme contexte de traduction. La démo officielle utilise des exemples de dialogues de (Le voyage vers l’Ouest) et des homophones pour montrer comment l’image aide à déterminer le sens des mots.
Le modèle exploitera aussi des historiques de dialogue plus longs pour garantir la cohérence terminologique. Si un nom, un projet ou un produit apparaît déjà dans le passage précédent, les renvois et abréviations dans la suite peuvent s’appuyer sur la traduction antérieure, plutôt que d’être devinés à chaque phrase.
Cela le rend plus adapté aux réunions continues, pas seulement à la traduction d’une seule prise vocale indépendante. Toutefois, l’official n’a pas encore précisé sur quelle durée le contexte peut être couvert de manière stable, et n’a pas montré de mémoire de long terme entre plusieurs réunions ; au contraire, la mémoire entre sessions est listée comme une direction à venir.
Pour comprendre « prise en charge de 60 langues », il faut le décomposer
Le modèle peut recevoir l’audio de 60 langues et produire un texte de traduction. La couverture inclut, en plus des langues courantes comme le chinois, l’anglais, le japonais, le coréen, le français et l’espagnol, aussi le cantonais, le bengali, le swahili, le kazakh, le kirghize et le malayalam, entre autres.
Mais la sortie vocale ne couvre que 29 langues parmi celles-ci. Ainsi, « prendre en charge 60 langues » ne signifie pas que toutes les combinaisons de langues bénéficient d’une traduction simultanée vocale qui conserve le timbre. Certaines langues ne peuvent produire que du texte.
L’official a évalué 70 directions de traduction sur le jeu de tests audio FLEURS publié, en examinant la qualité de traduction, la LAAL, le taux d’exactitude de la reconnaissance vocale et la qualité de synthèse vocale, et affirme que le nouveau modèle dépasse la génération précédente ainsi que plusieurs systèmes de traduction simultanée temps réel dominants.
Un autre test Omnilingua‑MSpeaker couvre 14 directions de traduction d’audio long impliquant plusieurs locuteurs. Les indicateurs incluent la fidélité, la fluidité, la concision et le taux d’erreur de séparation des locuteurs. L’official rapporte également que le nouveau modèle est globalement en avance.
Ces résultats relèvent encore, à ce jour, d’autotests du fabricant. L’official n’a pas publié en même temps les valeurs complètes par langue, les intervalles de confiance, les détails de l’évaluation manuelle et les sorties originales ; de plus, le monde extérieur n’a pas encore effectué de reproduction indépendante. Par conséquent, on ne peut pas conclure, uniquement à partir des graphiques récapitulatifs, que le modèle est en avance sur chaque combinaison d’accents, de domaines et de langues.
Il s’agit pour l’instant d’un service cloud, pas d’un modèle ouvert téléchargeable
Bien que la série Qwen publie souvent des modèles à poids ouverts, pour Qwen3.8‑LiveTranslate, cette fois, aucun poids téléchargeable n’a été publié, et aucun détail n’a été donné sur le nombre total de paramètres, les paramètres activés, la puissance de calcul d’entraînement ou la composition des données d’entraînement. Pour l’heure, il est possible de l’utiliser via l’interface WebSocket temps réel de QwenCloud et DashScope.
Les prix indiqués sur la page du modèle pour l’international sont : entrée audio à 7,5 USD par million de tokens, entrée image à 0,55 USD, sortie texte à 20 USD, sortie vocale à 30 USD. Le total de contexte est de 53K tokens, dont une limite d’entrée de 49K et une limite de sortie de 4K.
Le taux de conversion entre les tokens audio et le nombre de minutes effectif n’est pas indiqué sur la page du modèle. On ne peut donc pas calculer précisément « le coût d’une réunion d’une heure » uniquement à partir de ces tarifs. De plus, la saisie vocale et la sortie vocale peuvent être facturées simultanément, et un contexte vidéo peut aussi générer des tokens d’images.
Le déploiement côté cloud implique aussi que les voix de la réunion, les images et éventuellement des données utilisées pour cloner le timbre doivent être envoyées sur le serveur. Cette note technique ne discute pas en détail la conservation des données, l’autorisation pour cloner les timbres, les filigranes, ni les modalités de déploiement privé pour les entreprises. Ce sont des points à vérifier séparément lorsqu’on l’utilise en contexte médical, juridique et pour des réunions d’entreprise.
La vraie avancée, c’est de passer de « traduire des phrases » à « traduire une conversation ».
Ce qu’il faut surtout retenir de Qwen3.8‑LiveTranslate n’est pas simplement l’ajout de dizaines de langues, mais l’extension de l’objectif de la traduction en temps réel : passer d’une précision au niveau de la phrase à l’ensemble du processus d’échange. Le système maintient une faible latence, identifie différents locuteurs, conserve l’identité de la voix, affiche simultanément la transcription originale et l’audio traduit, et utilise l’image ainsi que le contexte historique pour garder une cohérence terminologique.
Le modèle n’a pas encore démontré qu’il peut remplacer un traducteur simultané professionnel. Les traducteurs gèrent les métaphores, les contextes culturels, les stratégies de prise de parole et les intentions non explicitement exprimées. De plus, le modèle actuel n’a pas publié d’évaluations complètes couvrant des situations à risque comme les prises de parole inattendues, un bruit sévère, de forts accents et des contextes diplomatiques ou médicaux à haut risque.
Mais la feuille de route technique est déjà assez claire : le prochain produit de traduction ne sera plus seulement « reconnaissance vocale + traduction automatique », mais tendra à devenir une couche d’échange multimodale continue, capable de percevoir en permanence les personnes, les voix, l’image et le contexte.
