OpenAI Lanzó GPT-Realtime-2.1 y Versión Mini para Agentes de Voz en la API
OpenAI lanzó dos nuevos modelos en la línea Realtime en su API—GPT-Realtime-2.1 y una versión compacta GPT-Realtime-2.1-mini para agentes de voz. La versión mini funciona como un modelo de razonamiento compacto para voz y cuesta lo mismo que el anterior gpt-realtime-mini. Gracias al cache mejorado, la latencia p95 se ha reducido en al menos 25%; la conexión funciona a través del protocolo WebRTC.
Procesado por IA desde MarkTechPost; editado por Hamidun News
OpenAI añadió dos nuevos modelos a su línea de API en tiempo real — GPT-Realtime-2.1 y la versión ligera GPT-Realtime-2.1-mini, diseñadas para agentes de voz con baja latencia de respuesta.
Qué hay de nuevo en la línea de tiempo real
GPT-Realtime-2.1-mini es un modelo de razonamiento compacto orientado a escenarios de voz. En términos de precio, corresponde al anterior gpt-realtime-mini, lo que significa que la transición a la nueva versión no aumenta el costo de uso para los desarrolladores que ya trabajan con el modelo mini anterior. La línea de API en tiempo real en OpenAI fue creada originalmente para tareas donde los modelos de texto con generación de respuesta intermedia no son adecuados: asistentes de voz, interfaces de soporte conversacionales y agentes que necesitan responder a la entrada del usuario con prácticamente ninguna pausa.
El lanzamiento de dos modelos a la vez — el más poderoso GPT-Realtime-2.1 y la versión mini ligera — brinda a los desarrolladores una opción entre un modelo de razonamiento más poderoso y una opción más asequible para escenarios donde la velocidad y el costo importan más que la profundidad del razonamiento en cada respuesta.
- Dos nuevos modelos: GPT-Realtime-2.1 y GPT-Realtime-2.1-mini
- GPT-Realtime-2.1-mini — modelo de razonamiento compacto para voz
- Precio de la versión mini comparable al anterior gpt-realtime-mini
- Latencia p95 reducida al menos un 25% mediante almacenamiento en caché mejorado
- Conexión a modelos — a través del protocolo WebRTC
Por qué la latencia p95 es importante
Para agentes de voz que deben responder a los usuarios en tiempo real, la latencia es uno de los indicadores clave de calidad: cuanto mayor sea, más mecánico e innatural se siente la conversación. La métrica p95 muestra la latencia que no se supera en el 95% de las solicitudes, lo que significa que refleja el comportamiento del sistema no en el mejor caso sino en el caso típico y cercano al peor. Una reducción de esta métrica en al menos un 25% mediante almacenamiento en caché mejorado significa que la gran mayoría de las respuestas de voz que el sistema ahora entrega son significativamente más rápidas que antes, sin cambiar el modelo de razonamiento en sí.
Cómo conectarse a los nuevos modelos
OpenAI preservó para la línea Realtime la conexión a través del protocolo WebRTC — el mismo método utilizado para versiones anteriores. Esto permite a los desarrolladores que ya han integrado agentes de voz basados en la API en tiempo real cambiar a los nuevos modelos sin cambiar el protocolo de transporte.
Qué significa esto
La actualización de la línea Realtime muestra que OpenAI continúa haciendo mejoras específicas en la infraestructura de agentes de voz — reduciendo la latencia y haciendo que los modelos de razonamiento para voz sean más asequibles, en lugar de solo lanzar versiones más poderosas pero también más caras.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.