36Kr (36氪)→ original

OpenAI a lancé les modèles vocaux GPT-Live-1 et GPT-Live-1 mini pour ChatGPT

OpenAI a mis à jour le mode vocal de ChatGPT : les nouveaux modèles GPT-Live-1 et le plus léger GPT-Live-1 mini fonctionnent avec une architecture full-duplex — écoutent et parlent simultanément. La différence principale : les utilisateurs peuvent interrompre la réponse de l'assistant à tout moment de la conversation, plutôt que d'attendre que le modèle finisse, comme avant.

Traité par IA depuis 36Kr (36氪) ; édité par Hamidun News
OpenAI a lancé les modèles vocaux GPT-Live-1 et GPT-Live-1 mini pour ChatGPT
Source : 36Kr (36氪). Collage: Hamidun News.
◐ Écouter l'article

OpenAI au début de juillet 2026 a lancé une nouvelle génération de modèles vocaux pour ChatGPT—GPT-Live-1 et une version allégée GPT-Live-1 mini, transitant complètement le mode vocal de l'assistant vers une architecture full-duplex. Le résumé technologique chinois 36Kr (36氪) a rapporté cela en citant des sources.

Ce qui a changé dans le mode vocal de ChatGPT

Les versions antérieures de l'assistant vocal de ChatGPT fonctionnaient selon le principe des tours stricts: l'utilisateur prononce une phrase, le modèle attend une pause et ne formule alors qu'une réponse qui ne peut pas être interrompue jusqu'à la fin. GPT-Live-1 et GPT-Live-1 mini changent complètement ce scénario—les deux modèles sont construits sur une architecture de "duplex intégral" qui permet au modèle d'accepter simultanément la parole de l'utilisateur et de générer la sienne, au lieu de travailler en tours.

  • Les nouveaux modèles sont nommés GPT-Live-1 (version principale) et GPT-Live-1 mini (version allégée, pour les scénarios moins gourmands en ressources)
  • Les deux sont construits sur une architecture full-duplex—l'entrée et la génération vocales se font en parallèle, et non séquentiellement
  • L'utilisateur peut interrompre la réponse du modèle à tout moment de la conversation
  • La mise à jour affectait la fonctionnalité vocale entière de ChatGPT dans son ensemble

Pourquoi la conversation avec l'assistant est devenue plus naturelle

La principale conséquence du duplex intégral est l'élimination des pauses gênantes et des tours rigides caractéristiques des bots vocaux de la génération précédente. Si un utilisateur clarifie une question au milieu d'une phrase, change la formulation, ou veut simplement intervenir en disant "attends, ce n'est pas ce que je voulais dire," GPT-Live-1 réagit immédiatement plutôt que de terminer une réponse prégénérée jusqu'à la fin, comme cela s'est produit dans les modes vocaux antérieurs de ChatGPT.

Techniquement, le duplex intégral est plus complexe à implémenter que la chaîne familière "reconnaître la parole → formuler une réponse → synthétiser la voix": le modèle doit constamment décider s'il faut continuer à parler, écouter ou faire les deux simultanément sans créer d'effet d'écho et sans perdre le fil de la conversation. C'est précisément pour cela que de tels systèmes sont restés rares même chez les grands laboratoires jusqu'à récemment.

Pourquoi y a-t-il une version allégée

L'existence de deux modèles—GPT-Live-1 et GPT-Live-1 mini—est une approche typique pour les services vocaux où la latence de réponse est critique pour la sensation d'un dialogue "en direct". La version allégée est conçue pour les scénarios où la rapidité de la réponse et la charge d'infrastructure inférieure importent davantage, tandis que le modèle principal peut être utilisé lorsque la qualité et la précision de la réponse sont la priorité.

Où cela sera utile d'abord

La réactivité dans la conversation est particulièrement remarquable lorsque la voix est le seul moyen d'interagir avec l'assistant: en conduisant, en travaillant avec les mains, dans les scénarios de dictée ou de support client vocal. Dans de telles situations, une seconde supplémentaire d'attente ou l'incapacité à corriger rapidement le modèle se sent beaucoup plus intensément que dans un chat textuel où on peut simplement ajouter une clarification dans le message suivant. Le duplex intégral élimine précisément cette source de frustration—la conversation se déroule sans pauses artificielles de "parlez après le signal".

Ce que cela signifie

Le lancement de GPT-Live-1 montre que la compétition dans les assistants vocaux d'IA s'est déplacée de la qualité pure de la synthèse vocale vers le naturel du dialogue lui-même—à quel point la conversation avec le modèle semble vivante plutôt qu'un échange de répliques avec un répondeur. Les utilisateurs qui communiquent de plus en plus avec ChatGPT par la voix plutôt que par le texte obtiennent un assistant qui se comporte plus comme un partenaire de conversation en direct avec ses interruptions et clarifications, plutôt qu'un menu vocal classique avec des scénarios rigides. Étant donné que Google possède déjà son propre mode vocal Gemini Live, la mise à jour du moteur vocal de ChatGPT semble être une réponse directe à la concurrence croissante pour les utilisateurs qui préfèrent parler à l'IA plutôt que de taper.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…