OpenAI открыла API полнодуплексной голосовой модели GPT-Live-1.
OpenAI открыла API полнодуплексной голосовой модели GPT-Live-1. Стоимость составляет 5 центов за минуту. Модель одновременно слушает и синтезирует речь, заменяя традиционный каскад STT-LLM-TTS.
Единая архитектура снизила задержку реакции с 1,4 до 0,8 секунды и позволила обрабатывать перебивания. Обновленная фильтрация пауз и фонового шума сократила число ложных прерываний на 80%.
GPT-Live-1 поддерживает делегирование вычислений: голосовой фронтенд удерживает непрерывный контакт с пользователем, а бэкенд на GPT-6 Astra и Luna параллельно выполняет рассуждения и вызовы инструментов.
Модель готова к интеграции в телефонию. API может возвращать ASR-транскрипты, включает 12 голосов и поддерживает управление темпом и стилем речи через системный промпт.

