36Kr (36氪)→ оригинал

OpenAI выпустила голосовые модели GPT-Live-1 и GPT-Live-1 mini для ChatGPT

OpenAI обновила голосовой режим ChatGPT: новые модели GPT-Live-1 и облегчённая GPT-Live-1 mini работают на архитектуре полного дуплекса — слушают и говорят одновременно. Главное отличие: пользователь может перебить ответ ассистента в любой момент разговора, а не ждать, пока модель договорит до конца, как раньше.

AI-обработка оригинала 36Kr (36氪); редакция Hamidun News
OpenAI выпустила голосовые модели GPT-Live-1 и GPT-Live-1 mini для ChatGPT
Источник: 36Kr (36氪). Коллаж: Hamidun News.
◐ Слушать статью

OpenAI в начале июля 2026 года выпустила новое поколение голосовых моделей для ChatGPT — GPT-Live-1 и облегчённую версию GPT-Live-1 mini, полностью переведя голосовой режим ассистента на архитектуру полного дуплекса. Об этом со ссылкой на источники сообщил китайский технологический дайджест 36Kr (36氪).

Что изменилось в голосовом режиме ChatGPT

Прежние версии голосового ассистента ChatGPT работали по принципу строгой очерёдности: пользователь произносит фразу, модель дожидается паузы и только потом формирует ответ, который нельзя было прервать до самого конца. GPT-Live-1 и GPT-Live-1 mini меняют этот сценарий полностью — обе модели построены на архитектуре "полного дуплекса" (full duplex), которая позволяет одновременно принимать речь пользователя и генерировать собственную, вместо того чтобы работать по очереди.

  • Новые модели называются GPT-Live-1 (основная версия) и GPT-Live-1 mini (облегчённая, для менее ресурсоёмких сценариев)
  • Обе построены на архитектуре полного дуплекса — приём и генерация речи идут параллельно, а не последовательно
  • Пользователь может прервать ответ модели в любой момент разговора
  • Обновление затронуло весь голосовой функционал ChatGPT целиком

Почему разговор с ассистентом стал естественнее

Главное следствие полного дуплекса — исчезновение неловких пауз и жёсткой очерёдности реплик, характерных для голосовых ботов прошлого поколения. Если пользователь на середине фразы уточняет вопрос, меняет формулировку или просто хочет перебить модель словами "подожди, я не это имел в виду", GPT-Live-1 реагирует сразу, а не доигрывает заранее сгенерированный ответ до конца, как это происходило в более ранних голосовых режимах ChatGPT.

Технически полный дуплекс сложнее в реализации, чем привычная связка "распознать речь → сформировать ответ → синтезировать голос": модели приходится постоянно решать, продолжать говорить, слушать или делать и то и другое одновременно, не создавая эффекта наложения голосов и не теряя нить разговора. Именно поэтому подобные системы долго оставались редкостью даже у крупных лабораторий.

Зачем нужна облегчённая версия mini

Наличие двух моделей — GPT-Live-1 и GPT-Live-1 mini — типичный ход для голосовых сервисов, где задержка ответа критична для ощущения "живого" диалога. Облегчённая версия рассчитана на сценарии, где важнее скорость реакции и меньшая нагрузка на инфраструктуру, тогда как основная модель может использоваться там, где приоритет — качество и точность ответа.

Где это пригодится в первую очередь

Отзывчивость в разговоре особенно заметна там, где голос — единственный способ взаимодействия с ассистентом: за рулём, при работе руками, в сценариях диктовки или голосовой поддержки клиентов. В таких ситуациях лишняя секунда ожидания или невозможность быстро поправить модель ощущаются гораздо острее, чем в текстовом чате, где можно просто дописать уточнение следующим сообщением. Полный дуплекс убирает именно этот источник раздражения — разговор течёт без искусственных пауз "говорите после сигнала".

Что это значит

Запуск GPT-Live-1 показывает, что конкуренция голосовых AI-ассистентов сместилась с чистого качества синтеза речи на естественность самого диалога — насколько разговор с моделью ощущается живым, а не обменом репликами с автоответчиком. Пользователи, которые всё чаще общаются с ChatGPT голосом, а не текстом, получают ассистента, который ведёт себя ближе к живому собеседнику с его перебиваниями и уточнениями, чем к классическому голосовому меню с жёсткими сценариями. Учитывая, что у Google уже есть собственный голосовой режим Gemini Live, обновление голосового движка ChatGPT выглядит прямым ответом на растущую конкуренцию за пользователей, которые предпочитают говорить с AI, а не печатать.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…