ChatGPT научился слушать и говорить одновременно: что умеет новая голосовая модель GPT-Live

Источник фото: Press service
OpenAI внедрила в ChatGPT полнодуплексную голосовую модель GPT-Live, которая одновременно слушает и отвечает, не заставляя ждать пауз, — и даже использует междометия вроде «ага» или «хм», чтобы вы чувствовали, что вас слышат.
Диалог с голосовым ассистентом всегда напоминал игру в теннис: вы подаёте фразу, он отбивает ответ, и пока мяч не прилетел обратно, приходится стоять с открытым ртом. OpenAI решила эту проблему, выпустив GPT-Live — семейство моделей с полнодуплексной архитектурой, которая позволяет ChatGPT слышать и говорить одновременно.
Технически это означает отказ от классической схемы «запись аудио — распознавание речи — генерация текста — синтез речи», где каждый шаг занимает время. Вместо этого GPT-Live обрабатывает поток звука в реальном времени, способен вставлять короткие междометия (показывая, что он вас слушает), перебивать собеседника или, наоборот, делать паузы, если пользователь задумался. Разговор перестаёт быть механическим обменом репликами и становится похож на нормальный человеческий диалог.
Важная деталь: модель умеет работать в связке с другими ИИ от OpenAI. Если пользователь просит, например, найти актуальные новости или выполнить сложный анализ, GPT-Live передаёт задачу вспомогательной модели (на первом этапе это GPT-5.5), а сам продолжает поддерживать беседу без прерываний. Пользователь не замечает переключения — просто получает ответ, который потребовал фоновых вычислений. Иронично, что многие пользователи даже не предполагали, что старый голосовой режим так сильно «заикался» именно из-за этой архитектурной задержки.
Сейчас GPT-Live-1 внедряется для подписчиков тарифов Go, Plus и Pro в веб-версии, а также в приложениях iOS и Android. Бесплатным пользователям достанется облегчённая версия GPT-Live-1 mini, которой, скорее всего, придётся чаще ждать очередь на сервере. OpenAI анонсировала, что в будущем выпустит API для разработчиков, но сроки пока не называет. Любопытно, что для ряда популярных языков модель уже оптимизирована, но на некоторых языках, по собственному признанию компании, она может говорить с акцентом или менее бегло — как будто иммигрант, который учит язык по аудиокурсам.
Логично, что такая технология в первую очередь нацелена на коммерческие сценарии: колл-центры, автоматизированные ассистенты и живые интервью. Однако в массовом сознании она может изменить представление о голосовых интерфейсах — когда пользователь начнёт забывать, что говорит с машиной, а не с живым оператором. Правда, остаётся открытым вопрос приватности: если модель постоянно слушает и может прерывать, где гарантия, что она не записывает всё без разбора, а не только то, что нужно для ответа? Компания традиционно умалчивает подобные детали, оставляя пользователям утешаться обещаниями безопасности.













