Google lanza Gemini 3.5 Live Translate: modelo de voz a voz para 70+ idiomas
El 9 de junio de 2026, Google lanzó Gemini 3.5 Live Translate — un modelo que traduce voz a voz en tiempo real en más de 70 idiomas. El audio se genera de forma continua, manteniéndose varios segundos detrás del hablante. La función está disponible a través de Gemini Live API, Google Meet y la aplicación Google Traductor.
Procesado por IA desde MarkTechPost; editado por Hamidun News
Google Lanzó Gemini 3.5 Live Translate: Modelo Habla-a-Habla para 70+ Idiomas
Google lanzó Gemini 3.5 Live Translate — un modelo de transmisión para traducción simultánea de voz en tiempo real que admite más de 70 idiomas. Según MarkTechPost el 9 de junio de 2026, el nuevo modelo traduce la voz directamente a voz, generando audio como una corriente continua con solo unos segundos de retraso respecto al hablante. El desarrollo está disponible a través de la API Gemini Live, y también está integrado en Google Meet y la aplicación Google Translate.
Cómo Funciona la Traducción en Transmisión
A diferencia de los sistemas clásicos de traducción automática que primero reconocen la voz por completo, traducen el texto y solo luego sintetizan el audio, Gemini 3.5 Live Translate funciona con un principio de transmisión: el modelo procesa el sonido entrante en fragmentos y comienza a generar voz traducida casi de inmediato, sin esperar a que el hablante termine su frase. Es precisamente por esto que el retraso se reduce a solo unos segundos — una latencia comparable con la interpretación simultánea profesional en una conferencia, en lugar de la pausa familiar en las aplicaciones de traductor que procesan la grabación completa.
Datos clave sobre el lanzamiento:
- El modelo se llama Gemini 3.5 Live Translate y pertenece a la familia Gemini de Google.
- Admite traducción de voz a más de 70 idiomas.
- Funciona en modo habla-a-habla en transmisión con solo unos segundos de retraso respecto al original.
- Disponible a través de API Gemini Live para desarrolladores de terceros.
- Integrado en Google Meet y la aplicación Google Translate.
Dónde Aparecerá el Modelo
Google está integrando Gemini 3.5 Live Translate en varios de sus productos a la vez. En Google Meet, el modelo podrá proporcionar traducción de conversación entre participantes en llamadas de video en diferentes idiomas prácticamente sin retraso, lo que cierra una brecha de larga data en servicios de comunicación de video — hasta ahora la mayoría de ellos se basaban en traducción de subtítulos en lugar de traducción de voz en vivo. En la aplicación Google Translate, el nuevo modelo reemplaza o complementa mecanismos de traducción de voz anteriores, haciendo el modo de conversación de la aplicación más natural para viajeros y negociaciones comerciales.
Por separado, el modelo está abierto para desarrolladores a través de la API Gemini Live — una interfaz de programación que permite incrustar funcionalidad en tiempo real (audio, video, texto) en aplicaciones de terceros. Esto significa que la traducción habla-a-habla será usable no solo por los propios productos de Google sino por cualquier empresa que cree centros de llamadas, plataformas educativas, asistentes de soporte al cliente, o sistemas para eventos internacionales.
Un Largo Camino hacia la Traducción de Voz en Vivo
La idea de traducción automática simultánea de voz no es nueva: los auriculares traductores de voz y las aplicaciones con funcionalidad "libreta de frases" han existido durante años, pero casi todas sufrían del mismo problema — una pausa notable entre la observación y la traducción, que convirtió el diálogo natural en un intercambio de monólogos con espera. Cada eslabón en el pipeline clásico — reconocimiento de voz, traducción de texto automática, síntesis de voz — añadía su propio retraso y su propia fuente de errores, y las discordancias entre etapas podían distorsionar la entonación, las pausas e incluso el significado. La arquitectura de transmisión que combina todos estos pasos en un único modelo es la respuesta a precisamente este problema, y el hecho de que Google lo lance inmediatamente en productos masivos como Meet y Translate, en lugar de mantenerlo en estado experimental, habla de la disposición de la empresa de escalar la tecnología a millones de usuarios.
Qué Cambia Esto para Desarrolladores y Negocios
La disponibilidad de un modelo de traducción de transmisión accesible a través de API reduce la barrera de entrada para empresas que anteriormente tenían que contratar un equipo de traductores o integrar servicios dispares para reconocimiento de voz, traducción de texto y síntesis de voz por separado — con retrasos correspondientes en cada etapa. Un modelo habla-a-habla unificado simplifica la arquitectura de tales productos y potencialmente reduce la latencia acumulada y los costos de servicio.
Para usuarios finales, el efecto principal es acercar la traducción automática a la experiencia de la interpretación simultánea en vivo en escenarios cotidianos: llamadas de video, viajes, negociaciones. Teniendo en cuenta que Google está desarrollando simultáneamente Gemini como un ecosistema de modelos e integrando nuevas capacidades en sus productos masivos — Meet, Translate, búsqueda y servicios de oficina — la traducción de voz en transmisión podría convertirse bastante rápidamente en una característica estándar en lugar de una capacidad de nicho disponible solo a través de servicios especializados de interpretación simultánea.
La pregunta sobre la calidad de la traducción en escenarios complejos sigue abierta — con observaciones superpuestas de múltiples hablantes, fuerte ruido de fondo, o terminología altamente especializada, donde incluso los intérpretes simultáneos profesionales cometen errores. El retraso de unos segundos que Google menciona es un compromiso entre velocidad y precisión: cuanto menos contexto logra acumular el modelo antes de generar una traducción, mayor es el riesgo de imprecisiones en frases largas y sintácticamente complejas. Sin embargo, el simple hecho de que tal funcionalidad ahora esté integrada en herramientas cotidianas como Google Meet, en lugar de requerir equipos especializados separados, reduce significativamente la barrera para la comunicación internacional en negocios y vida cotidiana.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.