36Kr (36氪)→ original

OpenAI lançou modelos de voz GPT-Live-1 e GPT-Live-1 mini para ChatGPT

OpenAI atualizou o modo de voz do ChatGPT: os novos modelos GPT-Live-1 e o mais leve GPT-Live-1 mini funcionam com arquitetura full-duplex — ouvem e falam simultaneamente. A principal diferença: os usuários podem interromper a resposta do assistente em qualquer momento da conversa, em vez de esperar que o modelo termine, como antes.

Processado por IA de 36Kr (36氪); editado por Hamidun News
OpenAI lançou modelos de voz GPT-Live-1 e GPT-Live-1 mini para ChatGPT
Fonte: 36Kr (36氪). Colagem: Hamidun News.
◐ Ouvir artigo

A OpenAI no início de julho de 2026 lançou uma nova geração de modelos de voz para ChatGPT—GPT-Live-1 e uma versão leve GPT-Live-1 mini, transitando completamente o modo de voz do assistente para uma arquitetura full-duplex. O resumo de tecnologia chinês 36Kr (36氪) reportou isso citando fontes.

O que mudou no modo de voz do ChatGPT

As versões anteriores do assistente de voz do ChatGPT operavam sob o princípio de turnos estritos: o usuário pronuncia uma frase, o modelo aguarda uma pausa e apenas então formula uma resposta que não pode ser interrompida até o final. GPT-Live-1 e GPT-Live-1 mini mudam completamente este cenário—ambos os modelos são construídos em uma arquitetura de "full duplex" que permite ao modelo aceitar simultaneamente a fala do usuário e gerar a sua própria, em vez de trabalhar por turnos.

  • Os novos modelos são nomeados GPT-Live-1 (versão principal) e GPT-Live-1 mini (versão leve, para cenários menos intensivos em recursos)
  • Ambos são construídos em uma arquitetura full-duplex—entrada e geração de fala acontecem em paralelo, não sequencialmente
  • O usuário pode interromper a resposta do modelo em qualquer ponto da conversa
  • A atualização afetou toda a funcionalidade de voz do ChatGPT como um todo

Por que a conversa com o assistente se tornou mais natural

A principal consequência do full duplex é a eliminação das pausas desconfortáveis e turnos rígidos característicos dos bots de voz da geração anterior. Se um usuário esclarece uma pergunta no meio de uma frase, muda a formulação, ou simplesmente quer interromper com "espera, não era isso que queria dizer," GPT-Live-1 reage imediatamente em vez de terminar uma resposta pré-gerada até o fim, como acontecia em modos de voz anteriores do ChatGPT.

Tecnicamente, full duplex é mais complexo de implementar do que a familiar sequência "reconhecer fala → formular resposta → sintetizar voz": o modelo deve constantemente decidir se continuar falando, ouvir ou fazer ambas simultaneamente sem criar um efeito de eco e sem perder o fio da conversa. É precisamente por isso que tais sistemas permaneceram raros mesmo entre laboratórios maiores até recentemente.

Por que há uma versão leve

A existência de dois modelos—GPT-Live-1 e GPT-Live-1 mini—é uma abordagem típica para serviços de voz onde a latência de resposta é crítica para a sensação de diálogo "ao vivo". A versão leve é projetada para cenários onde a velocidade de resposta e a menor carga de infraestrutura importam mais, enquanto o modelo principal pode ser usado onde a qualidade e precisão da resposta são a prioridade.

Onde isto será útil primeiro

A capacidade de resposta na conversa é especialmente notável onde voz é a única forma de interagir com o assistente: enquanto dirige, enquanto trabalha com as mãos, em cenários de ditado ou suporte ao cliente por voz. Em tais situações, um segundo extra de espera ou incapacidade de corrigir rapidamente o modelo se sente muito mais agudamente do que em um chat de texto onde se pode simplesmente adicionar um esclarecimento na próxima mensagem. Full duplex remove precisamente essa fonte de frustração—a conversa flui sem pausas artificiais de "fale após o sinal".

O que isso significa

O lançamento de GPT-Live-1 mostra que a competição em assistentes de IA de voz mudou da qualidade pura de síntese de fala para a naturalidade do diálogo em si—quanto a conversa com o modelo parece viva em vez de uma troca de linhas com uma máquina de atendimento. Usuários que cada vez mais se comunicam com ChatGPT por voz em vez de texto obtêm um assistente que se comporta mais perto de um parceiro de conversa ao vivo com suas interrupções e esclarecimentos, em vez de um menu de voz clássico com cenários rígidos. Dado que Google já tem seu próprio modo de voz Gemini Live, a atualização do motor de voz do ChatGPT parece ser uma resposta direta à competição crescente pelos usuários que preferem falar com IA em vez de digitar.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…