OpenAI выпустила GPT-Live — новое поколение голосовых моделей для ChatGPT. Главное изменение — переход на архитектуру full-duplex. Прошлые версии ждали тишины для ответа и часто перебивали из-за фонового шума. Теперь нейросеть обрабатывает входящее аудио и генерирует ответ одновременно. Она решает говорить, слушать или молчать много раз в секунду.
В разговоре это убирает технические задержки и жесткую очередность. GPT-Live умеет издавать поддерживающие междометия, игнорирует долгие паузы пользователя и адекватно реагирует на перебивания. Архитектуру разделили на две части. За непрерывное общение отвечает быстрый голосовой движок. Сложные задачи вроде веб-поиска или вычислений делегируются фоновой модели GPT-5.5. Пока идет поиск, GPT-Live продолжает поддерживать диалог без пауз.
Сейчас глобально разворачиваются две версии: GPT-Live-1 и GPT-Live-1 mini. В приложении ChatGPT они научились параллельно выводить интерфейсные виджеты с данными прямо во время разговора. Разработчики могут записаться в лист ожидания для получения доступа к API.
Поделиться:
Нил Бломкамп выпустил 13-минутный научно-фантастический фильм NIGHTBORNE, полностью сгенерированный в нейросети Seedance 2.0
Управление глубиной рассуждений в LLM: механика обучения через проверяемые награды