36Kr (36氪)→ original

OpenAI lanzó modelos de voz GPT-Live-1 y GPT-Live-1 mini para ChatGPT

OpenAI actualizó el modo de voz de ChatGPT: los nuevos modelos GPT-Live-1 y el más ligero GPT-Live-1 mini funcionan con arquitectura full-duplex — escuchan y hablan simultáneamente. La principal diferencia: los usuarios pueden interrumpir la respuesta del asistente en cualquier momento de la conversación, en lugar de esperar a que el modelo termine, como antes.

Procesado por IA desde 36Kr (36氪); editado por Hamidun News
OpenAI lanzó modelos de voz GPT-Live-1 y GPT-Live-1 mini para ChatGPT
Fuente: 36Kr (36氪). Collage: Hamidun News.
◐ Escuchar artículo

OpenAI a principios de julio de 2026 lanzó una nueva generación de modelos de voz para ChatGPT—GPT-Live-1 y una versión ligera GPT-Live-1 mini, transitando completamente el modo de voz del asistente a una arquitectura de dúplex completo. El resumen tecnológico chino 36Kr (36氪) reportó esto citando fuentes.

Qué cambió en el modo de voz de ChatGPT

Las versiones anteriores del asistente de voz de ChatGPT operaban bajo el principio de turnos estrictos: el usuario pronuncia una frase, el modelo espera una pausa y solo entonces formula una respuesta que no se puede interrumpir hasta el final. GPT-Live-1 y GPT-Live-1 mini cambian completamente este escenario—ambos modelos están construidos en una arquitectura de "dúplex completo" que permite al modelo aceptar simultáneamente el habla del usuario y generar la suya, en lugar de trabajar por turnos.

  • Los nuevos modelos se llaman GPT-Live-1 (versión principal) y GPT-Live-1 mini (versión ligera, para escenarios menos intensivos en recursos)
  • Ambos están construidos en una arquitectura de dúplex completo—la entrada y generación de voz ocurren en paralelo, no secuencialmente
  • El usuario puede interrumpir la respuesta del modelo en cualquier punto de la conversación
  • La actualización afectó la funcionalidad de voz completa de ChatGPT en su conjunto

Por qué la conversación con el asistente se volvió más natural

La principal consecuencia del dúplex completo es la eliminación de las pausas incómodas y los turnos rígidos característicos de los bots de voz de la generación anterior. Si un usuario clarifica una pregunta en medio de una frase, cambia la formulación, o simplemente quiere interrumpir con "espera, eso no es lo que quise decir," GPT-Live-1 reacciona inmediatamente en lugar de terminar una respuesta pregenerada hasta el final, como sucedía en los modos de voz anteriores de ChatGPT.

Técnicamente, el dúplex completo es más complejo de implementar que la cadena familiar "reconocer voz → formular respuesta → sintetizar voz": el modelo debe decidir constantemente si continuar hablando, escuchar o hacer ambas cosas simultáneamente sin crear un efecto de eco y sin perder el hilo de la conversación. Precisamente por esto tales sistemas han permanecido raros incluso entre laboratorios principales hasta recientemente.

Por qué hay una versión ligera

La existencia de dos modelos—GPT-Live-1 y GPT-Live-1 mini—es un enfoque típico para servicios de voz donde la latencia de respuesta es crítica para la sensación de diálogo "en vivo". La versión ligera está diseñada para escenarios donde importan más la velocidad de respuesta y la menor carga de infraestructura, mientras que el modelo principal puede usarse donde la prioridad es la calidad y precisión de la respuesta.

Dónde será útil primero

La capacidad de respuesta en la conversación es especialmente notable donde la voz es la única forma de interactuar con el asistente: mientras se conduce, mientras se trabaja con las manos, en escenarios de dictación o soporte de cliente de voz. En tales situaciones, un segundo extra de espera o la incapacidad de corregir rápidamente el modelo se siente mucho más intensamente que en un chat de texto donde se puede simplemente añadir una aclaración en el siguiente mensaje. El dúplex completo elimina precisamente esta fuente de frustración—la conversación fluye sin pausas artificiales de "habla después de la señal".

Qué significa esto

El lanzamiento de GPT-Live-1 muestra que la competencia en asistentes de IA de voz se ha desplazado de la calidad pura de la síntesis de voz a la naturalidad del diálogo en sí—cuánto la conversación con el modelo se siente viva en lugar de un intercambio de líneas con una máquina contestadora. Los usuarios que cada vez más se comunican con ChatGPT por voz en lugar de texto obtienen un asistente que se comporta más cerca de un compañero de conversación en vivo con sus interrupciones y aclaraciones, en lugar de un menú de voz clásico con escenarios rígidos. Dado que Google ya tiene su propio modo de voz Gemini Live, la actualización del motor de voz de ChatGPT se ve como una respuesta directa a la creciente competencia por los usuarios que prefieren hablar con IA en lugar de escribir.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…