Google lance Gemini 3.5 Live Translate : modèle parole-à-parole pour 70+ langues
Le 9 juin 2026, Google a lancé Gemini 3.5 Live Translate — un modèle qui traduit la parole en parole en temps réel dans plus de 70 langues. L'audio est généré en continu, restant quelques secondes en arrière du locuteur. La fonction est disponible via l'API Gemini Live, Google Meet et l'application Google Traduction.
Traité par IA depuis MarkTechPost ; édité par Hamidun News
Google a Lancé Gemini 3.5 Live Translate : Modèle Parole-à-Parole pour 70+ Langues
Google a lancé Gemini 3.5 Live Translate — un modèle de streaming pour la traduction vocale simultanée en temps réel supportant plus de 70 langues. Selon MarkTechPost le 9 juin 2026, le nouveau modèle traduit la parole directement en parole, générant l'audio sous forme de flux continu avec seulement quelques secondes de décalage par rapport au locuteur. Le développement est disponible via l'API Gemini Live, et est également intégré à Google Meet et à l'application Google Translate.
Comment Fonctionne la Traduction en Streaming
Contrairement aux systèmes classiques de traduction automatique qui reconnaissent d'abord la parole complètement, traduisent le texte et synthétisent ensuite seulement l'audio, Gemini 3.5 Live Translate fonctionne selon un principe de streaming: le modèle traite le son entrant par fragments et commence à générer la parole traduite presque immédiatement, sans attendre que le locuteur termine sa phrase. C'est précisément pourquoi le délai est réduit à seulement quelques secondes — une latence comparable à l'interprétation simultanée professionnelle lors d'une conférence, plutôt que la pause familière dans les applications de traducteur qui traitent l'enregistrement complet.
Faits clés sur le lancement:
- Le modèle s'appelle Gemini 3.5 Live Translate et appartient à la famille Gemini de Google.
- Supporte la traduction vocale en plus de 70 langues.
- Fonctionne en mode parole-à-parole en streaming avec seulement quelques secondes de décalage par rapport à l'original.
- Disponible via l'API Gemini Live pour les développeurs tiers.
- Intégré à Google Meet et à l'application Google Translate.
Où le Modèle Apparaîtra
Google intègre Gemini 3.5 Live Translate dans plusieurs de ses produits à la fois. Dans Google Meet, le modèle pourra fournir la traduction de conversation entre les participants aux appels vidéo dans différentes langues pratiquement sans délai, ce qui comble un fossé de longue date dans les services de communication vidéo — jusqu'à présent, la plupart d'entre eux s'appuyaient sur la traduction de sous-titres plutôt que sur la traduction vocale en direct. Dans l'application Google Translate, le nouveau modèle remplace ou complète les mécanismes de traduction vocale précédents, rendant le mode conversationnel de l'application plus naturel pour les voyageurs et les négociations commerciales.
Séparément, le modèle est ouvert aux développeurs via l'API Gemini Live — une interface de programmation qui permet d'intégrer les fonctionnalités en temps réel (audio, vidéo, texte) dans les applications tierces. Cela signifie que la traduction parole-à-parole pourra être utilisée non seulement par les propres produits de Google mais par n'importe quelle entreprise créant des centres d'appels, des plates-formes éducatives, des assistants du support client, ou des systèmes pour les événements internationaux.
Un Long Chemin vers la Traduction Vocale en Direct
L'idée de la traduction automatique vocale simultanée n'est pas nouvelle: les écouteurs traducteurs vocaux et les applications avec la fonctionnalité "carnet de phrases" existent depuis des années, mais presque tous souffraient du même problème — une pause notable entre la remarque et la traduction, qui transformait le dialogue naturel en un échange de monologues avec attente. Chaque maillon du pipeline classique — reconnaissance vocale, traduction de texte automatique, synthèse vocale — ajoutait son propre délai et sa propre source d'erreurs, et les désaccords entre les étapes pouvaient déformer l'intonation, les pauses et même le sens. L'architecture de streaming qui combine toutes ces étapes dans un seul modèle est la réponse à précisément ce problème, et le fait que Google la lance immédiatement dans des produits de masse comme Meet et Translate, plutôt que de la garder en statut expérimental, témoigne de la disponibilité de l'entreprise à dimensionner la technologie à des millions d'utilisateurs.
Qu'est-ce que
Cela Change pour les Développeurs et les Entreprises
La disponibilité d'un modèle de traduction en streaming accessible via l'API abaisse la barrière à l'entrée pour les entreprises qui devaient auparavant soit engager une équipe de traducteurs, soit intégrer des services disparates pour la reconnaissance vocale, la traduction de texte et la synthèse vocale séparément — avec des délais correspondants à chaque étape. Un modèle parole-à-parole unifié simplifie l'architecture de tels produits et réduit potentiellement la latence cumulative et les frais de service.
Pour les utilisateurs finaux, l'effet principal est de rapprocher la traduction automatique de l'expérience de l'interprétation simultanée en direct dans les scénarios quotidiens: appels vidéo, voyages, négociations. Étant donné que Google développe simultanément Gemini en tant qu'écosystème de modèles et intègre de nouvelles capacités dans ses produits de masse — Meet, Translate, recherche et services de bureau — la traduction vocale en streaming pourrait devenir assez rapidement une fonctionnalité standard plutôt qu'une capacité de niche disponible uniquement via les services spécialisés d'interprétation simultanée.
La question de la qualité de la traduction dans les scénarios complexes reste ouverte — avec des remarques qui se chevauchent de plusieurs locuteurs, un bruit de fond fort, ou une terminologie hautement spécialisée, où même les interprètes simultanés professionnels font des erreurs. Le délai de quelques secondes que Google mentionne est un compromis entre vitesse et précision: moins le modèle parvient à accumuler de contexte avant de générer une traduction, plus le risque d'inexactitudes sur les phrases longues et syntaxiquement complexes est élevé. Néanmoins, le simple fait qu'une telle fonctionnalité soit maintenant intégrée dans les outils quotidiens comme Google Meet, plutôt que d'exiger un équipement spécialisé séparé, abaisse considérablement la barrière à la communication internationale dans les affaires et la vie quotidienne.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.