OpenAI a Lancé GPT-Realtime-2.1 et une Version Mini pour les Agents Vocaux dans l'API
OpenAI a lancé deux nouveaux modèles dans la gamme Realtime pour son API—GPT-Realtime-2.1 et une version compacte GPT-Realtime-2.1-mini pour les agents vocaux. La version mini fonctionne comme un modèle de raisonnement compact pour la voix et coûte le même prix que le gpt-realtime-mini précédent. Grâce à la mise en cache améliorée, la latence p95 a été réduite d'au moins 25%; la connexion fonctionne via le protocole WebRTC.
Traité par IA depuis MarkTechPost ; édité par Hamidun News
OpenAI a ajouté deux nouveaux modèles à sa gamme d'API en temps réel — GPT-Realtime-2.1 et la version légère GPT-Realtime-2.1-mini, conçues pour les agents vocaux avec une latence de réponse faible.
Quoi de neuf dans la gamme Realtime
GPT-Realtime-2.1-mini est un modèle de raisonnement compact orienté vers les scénarios vocaux. En termes de prix, il correspond au gpt-realtime-mini antérieur, ce qui signifie que la transition vers la nouvelle version n'augmente pas le coût d'utilisation pour les développeurs travaillant déjà avec le modèle mini précédent. La gamme d'API Realtime chez OpenAI a été créée à l'origine pour les tâches où les modèles de texte avec génération de réponse intermédiaire ne conviennent pas : assistants vocaux, interfaces de support conversationnel et agents qui doivent répondre à l'entrée de l'utilisateur avec presque aucune pause.
La sortie de deux modèles à la fois — la GPT-Realtime-2.1 plus puissante et la version mini légère — donne aux développeurs le choix entre un modèle de raisonnement plus puissant et une option plus abordable pour les scénarios où la vitesse et le coût importent plus que la profondeur du raisonnement dans chaque réponse.
- Deux nouveaux modèles : GPT-Realtime-2.1 et GPT-Realtime-2.1-mini
- GPT-Realtime-2.1-mini — modèle de raisonnement compact pour la voix
- Prix de la version mini comparable au gpt-realtime-mini précédent
- Latence p95 réduite d'au moins 25% grâce à un meilleur caching
- Connexion aux modèles — via le protocole WebRTC
Pourquoi la latence p95 est-elle importante
Pour les agents vocaux qui doivent répondre aux utilisateurs en temps réel, la latence est l'un des indicateurs clés de qualité : plus elle est élevée, plus la conversation semble mécanique et non naturelle. La métrique p95 montre la latence qui n'est pas dépassée par 95% des demandes, ce qui signifie qu'elle reflète le comportement du système non dans le meilleur cas mais dans le cas typique et proche du pire cas. Une réduction de cette métrique d'au moins 25% grâce à un meilleur caching signifie que la grande majorité des réponses vocales que le système fournit maintenant est nettement plus rapide qu'avant, sans changer le modèle de raisonnement lui-même.
Comment se connecter aux nouveaux modèles
OpenAI a préservé pour la gamme Realtime la connexion via le protocole WebRTC — le même méthode utilisée pour les versions précédentes. Cela permet aux développeurs qui ont déjà intégré des agents vocaux basés sur l'API Realtime de basculer vers les nouveaux modèles sans changer le protocole de transport.
Ce que cela signifie
La mise à jour de la gamme Realtime montre qu'OpenAI continue d'apporter des améliorations ciblées à l'infrastructure des agents vocaux — réduisant la latence et rendant les modèles de raisonnement pour la voix plus abordables, plutôt que de simplement lancer des versions plus puissantes mais aussi plus chères.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.