OpenAI выпустила GPT-Realtime-2.1 и mini-версию для голосовых агентов в API
OpenAI выпустила в API две новые модели линейки Realtime — GPT-Realtime-2.1 и облегчённую GPT-Realtime-2.1-mini для голосовых агентов. Mini-версия работает как компактная модель рассуждений для голоса и стоит так же, как предыдущая gpt-realtime-mini. Благодаря улучшенному кешированию задержка p95 снижена минимум на 25%, подключение идёт по протоколу WebRTC.
AI-обработка оригинала MarkTechPost; редакция Hamidun News
OpenAI добавила в свой API две новые модели линейки Realtime — GPT-Realtime-2.1 и облегчённую GPT-Realtime-2.1-mini, предназначенные для голосовых агентов с низкой задержкой ответа.
Что нового в линейке Realtime
GPT-Realtime-2.1-mini — это компактная модель рассуждений, ориентированная на голосовые сценарии. По цене она соответствует более ранней gpt-realtime-mini, то есть переход на новую версию не увеличивает стоимость использования для разработчиков, уже работавших с предыдущей mini-моделью. Линейка Realtime в API OpenAI изначально создавалась под задачи, где текстовые модели с промежуточной генерацией ответа не подходят: голосовые ассистенты, разговорные интерфейсы поддержки и агенты, которым нужно реагировать на реплики пользователя почти без паузы.
Выпуск сразу двух моделей — старшей GPT-Realtime-2.1 и облегчённой mini-версии — даёт разработчикам выбор между более мощной моделью рассуждений и более дешёвым вариантом для сценариев, где важнее скорость и стоимость, чем глубина рассуждений в каждом ответе.
- Две новые модели: GPT-Realtime-2.1 и GPT-Realtime-2.1-mini
- GPT-Realtime-2.1-mini — компактная reasoning-модель для голоса
- Цена mini-версии сопоставима с предыдущей gpt-realtime-mini
- Задержка p95 снижена минимум на 25% благодаря улучшенному кешированию
- Подключение к моделям — по протоколу WebRTC
Почему важна задержка p95
Для голосовых агентов, которые должны отвечать пользователю в реальном времени, задержка — один из ключевых показателей качества: чем она выше, тем более механическим и неестественным ощущается разговор. Метрика p95 показывает задержку, которую не превышают 95% запросов, то есть отражает поведение системы не в лучшем, а в типичном и близком к худшему случае. Снижение этого показателя минимум на 25% за счёт улучшенного кеширования означает, что подавляющее большинство голосовых ответов система теперь выдаёт заметно быстрее, чем раньше, без изменения самой модели рассуждений.
Как подключиться к новым моделям
OpenAI сохранила для линейки Realtime подключение через протокол WebRTC — тот же способ, что использовался и для предыдущих версий. Это позволяет разработчикам, уже интегрировавшим голосовых агентов на базе Realtime API, переключиться на новые модели без смены транспортного протокола.
Что это значит
Обновление линейки Realtime показывает, что OpenAI продолжает точечно улучшать инфраструктуру голосовых агентов — снижая задержку и удешевляя доступ к reasoning-моделям для голоса, а не только выпуская более мощные, но и более дорогие версии.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.