OpenAI Lançou GPT-Realtime-2.1 e Versão Mini para Agentes de Voz na API
OpenAI lançou dois novos modelos na linha Realtime para sua API—GPT-Realtime-2.1 e uma versão compacta GPT-Realtime-2.1-mini para agentes de voz. A versão mini funciona como um modelo de raciocínio compacto para voz e custa o mesmo que o gpt-realtime-mini anterior. Graças ao cache melhorado, a latência p95 foi reduzida em pelo menos 25%; a conexão funciona via protocolo WebRTC.
Processado por IA de MarkTechPost; editado por Hamidun News
OpenAI adicionou dois novos modelos à sua linha de API em tempo real — GPT-Realtime-2.1 e a versão leve GPT-Realtime-2.1-mini, projetadas para agentes de voz com latência de resposta baixa.
O que há de novo na linha Realtime
GPT-Realtime-2.1-mini é um modelo de raciocínio compacto orientado para cenários de voz. Em termos de preço, corresponde ao anterior gpt-realtime-mini, o que significa que a transição para a nova versão não aumenta o custo de uso para desenvolvedores que já trabalham com o modelo mini anterior. A linha de API Realtime no OpenAI foi originalmente criada para tarefas onde modelos de texto com geração de resposta intermediária não são adequados: assistentes de voz, interfaces de suporte conversacional e agentes que precisam responder à entrada do usuário com praticamente nenhuma pausa.
O lançamento de dois modelos de uma vez — o mais poderoso GPT-Realtime-2.1 e a versão mini leve — oferece aos desenvolvedores uma opção entre um modelo de raciocínio mais poderoso e uma opção mais acessível para cenários onde a velocidade e o custo importam mais do que a profundidade do raciocínio em cada resposta.
- Dois novos modelos: GPT-Realtime-2.1 e GPT-Realtime-2.1-mini
- GPT-Realtime-2.1-mini — modelo de raciocínio compacto para voz
- Preço da versão mini comparável ao anterior gpt-realtime-mini
- Latência p95 reduzida em pelo menos 25% através de cache melhorado
- Conexão aos modelos — via protocolo WebRTC
Por que a latência p95 é importante
Para agentes de voz que devem responder aos usuários em tempo real, a latência é um dos indicadores-chave de qualidade: quanto maior for, mais mecânica e não natural a conversa parece. A métrica p95 mostra a latência que não é excedida em 95% das solicitações, o que significa que reflete o comportamento do sistema não no melhor caso, mas no caso típico e próximo ao pior. Uma redução dessa métrica de pelo menos 25% através de cache melhorado significa que a grande maioria das respostas de voz que o sistema agora fornece é significativamente mais rápida do que antes, sem alterar o próprio modelo de raciocínio.
Como conectar aos novos modelos
OpenAI preservou para a linha Realtime a conexão via protocolo WebRTC — o mesmo método usado para versões anteriores. Isso permite que desenvolvedores que já integraram agentes de voz com base na API Realtime mudem para os novos modelos sem alterar o protocolo de transporte.
O que isso significa
A atualização da linha Realtime mostra que OpenAI continua fazendo melhorias direcionadas na infraestrutura do agente de voz — reduzindo latência e tornando modelos de raciocínio para voz mais acessíveis, em vez de apenas lançar versões mais poderosas, mas também mais caras.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.