OpenAI представила GPT‑Realtime‑2 и два новых голосовых варианта, доступных только через API
OpenAI расширяет возможности голосового API
Компания объявила о запуске новых функций для своего API, которые позволят разработчикам создавать более «живые» голосовые приложения: они смогут говорить с пользователями, транскрибировать речь в текст и переводить разговоры на лету.
Новые модели Realtime
Через интерфейс Realtime теперь доступны три модели:
| Модель | Назначение | Ключевые особенности |
|---|---|---|
| GPT‑Realtime‑2 | Голосовое взаимодействие в реальном времени | Анализ запросов, вызов инструментов, обработка исправлений и плавное продолжение диалога. Основана на логике GPT‑5, что позволяет обрабатывать более сложные задачи по сравнению с GPT‑Realtime‑1.5. |
| GPT‑Realtime‑Translate | Перевод в реальном времени | Поддерживает 70+ языков ввода и 13 языков вывода. Сохраняет смысл даже при смене контекста, региональных акцентов или специализированной терминологии. |
| GPT‑Realtime‑Whisper | Транскрипция речи | Потоковая модель с низкой задержкой, превращающая аудио в текст почти мгновенно. |
> «Наши новые модели переводят аудио в реальном времени из простого диалога в голосовые интерфейсы, которые действительно могут работать: слушать, рассуждать, переводить, транскрибировать и предпринимать действия по мере развития разговора», — заявила компания.
Стоимость
| Модель | Цена |
|---|---|
| GPT‑Realtime‑2 | $32 за 1 млн входных аудиотокенов, $0.40 за 1 млн кешированных токенов и $64 за 1 млн выходных аудиотокенов |
| GPT‑Realtime‑Translate | $0.034 в минуту |
| GPT‑Realtime‑Whisper | $0.017 в минуту |
Как попробовать
Разработчики могут протестировать новые модели на онлайн-платформе OpenAI Playground и сразу увидеть, как они работают в реальном времени.
Комментарии (0)
Оставьте отзыв — пожалуйста, будьте вежливы и по теме.
Войти, чтобы комментировать