MarkTechPost→ original

OpenAI Lanzó GPT-Realtime-2.1 y Versión Mini para Agentes de Voz en la API

OpenAI lanzó dos nuevos modelos en la línea Realtime en su API—GPT-Realtime-2.1 y una versión compacta GPT-Realtime-2.1-mini para agentes de voz. La versión mini funciona como un modelo de razonamiento compacto para voz y cuesta lo mismo que el anterior gpt-realtime-mini. Gracias al cache mejorado, la latencia p95 se ha reducido en al menos 25%; la conexión funciona a través del protocolo WebRTC.

Procesado por IA desde MarkTechPost; editado por Hamidun News
OpenAI Lanzó GPT-Realtime-2.1 y Versión Mini para Agentes de Voz en la API
Fuente: MarkTechPost. Collage: Hamidun News.
◐ Escuchar artículo

OpenAI añadió dos nuevos modelos a su línea de API en tiempo real — GPT-Realtime-2.1 y la versión ligera GPT-Realtime-2.1-mini, diseñadas para agentes de voz con baja latencia de respuesta.

Qué hay de nuevo en la línea de tiempo real

GPT-Realtime-2.1-mini es un modelo de razonamiento compacto orientado a escenarios de voz. En términos de precio, corresponde al anterior gpt-realtime-mini, lo que significa que la transición a la nueva versión no aumenta el costo de uso para los desarrolladores que ya trabajan con el modelo mini anterior. La línea de API en tiempo real en OpenAI fue creada originalmente para tareas donde los modelos de texto con generación de respuesta intermedia no son adecuados: asistentes de voz, interfaces de soporte conversacionales y agentes que necesitan responder a la entrada del usuario con prácticamente ninguna pausa.

El lanzamiento de dos modelos a la vez — el más poderoso GPT-Realtime-2.1 y la versión mini ligera — brinda a los desarrolladores una opción entre un modelo de razonamiento más poderoso y una opción más asequible para escenarios donde la velocidad y el costo importan más que la profundidad del razonamiento en cada respuesta.

  • Dos nuevos modelos: GPT-Realtime-2.1 y GPT-Realtime-2.1-mini
  • GPT-Realtime-2.1-mini — modelo de razonamiento compacto para voz
  • Precio de la versión mini comparable al anterior gpt-realtime-mini
  • Latencia p95 reducida al menos un 25% mediante almacenamiento en caché mejorado
  • Conexión a modelos — a través del protocolo WebRTC

Por qué la latencia p95 es importante

Para agentes de voz que deben responder a los usuarios en tiempo real, la latencia es uno de los indicadores clave de calidad: cuanto mayor sea, más mecánico e innatural se siente la conversación. La métrica p95 muestra la latencia que no se supera en el 95% de las solicitudes, lo que significa que refleja el comportamiento del sistema no en el mejor caso sino en el caso típico y cercano al peor. Una reducción de esta métrica en al menos un 25% mediante almacenamiento en caché mejorado significa que la gran mayoría de las respuestas de voz que el sistema ahora entrega son significativamente más rápidas que antes, sin cambiar el modelo de razonamiento en sí.

Cómo conectarse a los nuevos modelos

OpenAI preservó para la línea Realtime la conexión a través del protocolo WebRTC — el mismo método utilizado para versiones anteriores. Esto permite a los desarrolladores que ya han integrado agentes de voz basados en la API en tiempo real cambiar a los nuevos modelos sin cambiar el protocolo de transporte.

Qué significa esto

La actualización de la línea Realtime muestra que OpenAI continúa haciendo mejoras específicas en la infraestructura de agentes de voz — reduciendo la latencia y haciendo que los modelos de razonamiento para voz sean más asequibles, en lugar de solo lanzar versiones más poderosas pero también más caras.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…