Google lança Gemini 3.5 Live Translate: modelo fala-a-fala para 70+ idiomas
Em 9 de junho de 2026, Google lançou Gemini 3.5 Live Translate — um modelo que traduz fala para fala em tempo real em 70+ idiomas. O áudio é gerado continuamente, mantendo-se alguns segundos atrás do falante. O recurso está disponível via API Gemini Live, Google Meet e aplicativo Google Tradutor.
Processado por IA de MarkTechPost; editado por Hamidun News
Google Lançou Gemini 3.5 Live Translate: Modelo Fala-para-Fala para 70+ Idiomas
Google lançou Gemini 3.5 Live Translate — um modelo de transmissão para tradução simultânea de voz em tempo real que suporta mais de 70 idiomas. De acordo com MarkTechPost em 9 de junho de 2026, o novo modelo traduz fala diretamente para fala, gerando áudio como um fluxo contínuo com apenas alguns segundos de atraso em relação ao falante. O desenvolvimento está disponível através da API Gemini Live, e também está integrado no Google Meet e no aplicativo Google Translate.
Como Funciona a Tradução em Transmissão
Ao contrário dos sistemas clássicos de tradução automática que primeiro reconhecem a fala completamente, traduzem o texto e apenas depois sintetizam o áudio, Gemini 3.5 Live Translate funciona com um princípio de transmissão: o modelo processa o som recebido em fragmentos e começa a gerar fala traduzida quase imediatamente, sem esperar que o falante termine sua frase. É precisamente por isso que o atraso é reduzido a apenas alguns segundos — uma latência comparável com interpretação simultânea profissional em uma conferência, em vez da pausa familiar em aplicativos de tradutor que processam a gravação inteira.
Fatos principais sobre o lançamento:
- O modelo é chamado Gemini 3.5 Live Translate e pertence à família Gemini do Google.
- Suporta tradução de voz para mais de 70 idiomas.
- Funciona em modo fala-para-fala em transmissão com apenas alguns segundos de atraso do original.
- Disponível através da API Gemini Live para desenvolvedores terceirizados.
- Integrado no Google Meet e no aplicativo Google Translate.
Onde o Modelo Aparecerá
Google está incorporando Gemini 3.5 Live Translate em vários de seus produtos simultaneamente. No Google Meet, o modelo poderá fornecer tradução de conversa entre participantes em chamadas de vídeo em idiomas diferentes praticamente sem atraso, o que fecha uma lacuna de longa data em serviços de comunicação por vídeo — até agora a maioria deles se baseava em tradução de legendas em vez de tradução de voz ao vivo. No aplicativo Google Translate, o novo modelo substitui ou complementa mecanismos de tradução de voz anteriores, tornando o modo de conversação do aplicativo mais natural para viajantes e negociações comerciais.
Separadamente, o modelo está aberto para desenvolvedores através da API Gemini Live — uma interface de programação que permite incorporar funcionalidade em tempo real (áudio, vídeo, texto) em aplicativos de terceiros. Isso significa que a tradução fala-para-fala será usável não apenas pelos produtos do Google mas por qualquer empresa que crie centros de atendimento, plataformas educacionais, assistentes de suporte ao cliente, ou sistemas para eventos internacionais.
Um Longo Caminho para Tradução de Voz ao Vivo
A ideia de tradução automática simultânea de voz não é nova: fones de ouvido tradutores de voz e aplicativos com funcionalidade "livro de frases" existem há anos, mas quase todos sofriam do mesmo problema — uma pausa notável entre a observação e a tradução, que transformava diálogo natural em um intercâmbio de monólogos com espera. Cada elo na pipeline clássica — reconhecimento de voz, tradução de texto automática, síntese de voz — adicionava seu próprio atraso e sua própria fonte de erros, e as incompatibilidades entre etapas podiam distorcer entonação, pausas e até significado. A arquitetura de transmissão que combina todos esses passos em um único modelo é a resposta a precisamente esse problema, e o fato de que Google está lançando imediatamente em produtos em massa como Meet e Translate, em vez de mantê-lo em status experimental, fala sobre a prontidão da empresa em dimensionar a tecnologia para milhões de usuários.
O que Isso Muda para Desenvolvedores e Negócios
A disponibilidade de um modelo de tradução de transmissão acessível via API reduz a barreira de entrada para empresas que anteriormente tinham que contratar uma equipe de tradutores ou integrar serviços separados para reconhecimento de voz, tradução de texto e síntese de voz separadamente — com atrasos correspondentes em cada etapa. Um modelo fala-para-fala unificado simplifica a arquitetura de tais produtos e potencialmente reduz latência cumulativa e custos de serviço.
Para usuários finais, o efeito principal é aproximar tradução automática da experiência de interpretação simultânea ao vivo em cenários cotidianos: chamadas de vídeo, viagens, negociações. Considerando que Google está simultaneamente desenvolvendo Gemini como um ecossistema de modelos e incorporando novas capacidades em seus produtos em massa — Meet, Translate, busca e serviços de escritório — tradução de voz em transmissão poderia se tornar bastante rapidamente um recurso padrão em vez de uma capacidade de nicho disponível apenas através de serviços especializados de interpretação simultânea.
A questão da qualidade de tradução em cenários complexos permanece aberta — com observações sobrepostas de múltiplos falantes, ruído de fundo forte, ou terminologia altamente especializada, onde até mesmo intérpretes simultâneos profissionais cometem erros. O atraso de alguns segundos que Google menciona é um compromisso entre velocidade e precisão: quanto menos contexto o modelo consegue acumular antes de gerar uma tradução, maior o risco de imprecisões em frases longas e sintaticamente complexas. No entanto, o simples fato de que tal funcionalidade agora está integrada em ferramentas cotidianas como Google Meet, em vez de exigir equipamentos especializados separados, reduz significativamente a barreira para comunicação internacional em negócios e vida cotidiana.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.