MarkTechPost→ original

OpenAI Lançou GPT-Realtime-2.1 e Versão Mini para Agentes de Voz na API

OpenAI lançou dois novos modelos na linha Realtime para sua API—GPT-Realtime-2.1 e uma versão compacta GPT-Realtime-2.1-mini para agentes de voz. A versão mini funciona como um modelo de raciocínio compacto para voz e custa o mesmo que o gpt-realtime-mini anterior. Graças ao cache melhorado, a latência p95 foi reduzida em pelo menos 25%; a conexão funciona via protocolo WebRTC.

Processado por IA de MarkTechPost; editado por Hamidun News
OpenAI Lançou GPT-Realtime-2.1 e Versão Mini para Agentes de Voz na API
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

OpenAI adicionou dois novos modelos à sua linha de API em tempo real — GPT-Realtime-2.1 e a versão leve GPT-Realtime-2.1-mini, projetadas para agentes de voz com latência de resposta baixa.

O que há de novo na linha Realtime

GPT-Realtime-2.1-mini é um modelo de raciocínio compacto orientado para cenários de voz. Em termos de preço, corresponde ao anterior gpt-realtime-mini, o que significa que a transição para a nova versão não aumenta o custo de uso para desenvolvedores que já trabalham com o modelo mini anterior. A linha de API Realtime no OpenAI foi originalmente criada para tarefas onde modelos de texto com geração de resposta intermediária não são adequados: assistentes de voz, interfaces de suporte conversacional e agentes que precisam responder à entrada do usuário com praticamente nenhuma pausa.

O lançamento de dois modelos de uma vez — o mais poderoso GPT-Realtime-2.1 e a versão mini leve — oferece aos desenvolvedores uma opção entre um modelo de raciocínio mais poderoso e uma opção mais acessível para cenários onde a velocidade e o custo importam mais do que a profundidade do raciocínio em cada resposta.

  • Dois novos modelos: GPT-Realtime-2.1 e GPT-Realtime-2.1-mini
  • GPT-Realtime-2.1-mini — modelo de raciocínio compacto para voz
  • Preço da versão mini comparável ao anterior gpt-realtime-mini
  • Latência p95 reduzida em pelo menos 25% através de cache melhorado
  • Conexão aos modelos — via protocolo WebRTC

Por que a latência p95 é importante

Para agentes de voz que devem responder aos usuários em tempo real, a latência é um dos indicadores-chave de qualidade: quanto maior for, mais mecânica e não natural a conversa parece. A métrica p95 mostra a latência que não é excedida em 95% das solicitações, o que significa que reflete o comportamento do sistema não no melhor caso, mas no caso típico e próximo ao pior. Uma redução dessa métrica de pelo menos 25% através de cache melhorado significa que a grande maioria das respostas de voz que o sistema agora fornece é significativamente mais rápida do que antes, sem alterar o próprio modelo de raciocínio.

Como conectar aos novos modelos

OpenAI preservou para a linha Realtime a conexão via protocolo WebRTC — o mesmo método usado para versões anteriores. Isso permite que desenvolvedores que já integraram agentes de voz com base na API Realtime mudem para os novos modelos sem alterar o protocolo de transporte.

O que isso significa

A atualização da linha Realtime mostra que OpenAI continua fazendo melhorias direcionadas na infraestrutura do agente de voz — reduzindo latência e tornando modelos de raciocínio para voz mais acessíveis, em vez de apenas lançar versões mais poderosas, mas também mais caras.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…