OpenAI представила GPT‑Realtime‑2 и два новых голосовых варианта, доступных только через API

OpenAI представила GPT‑Realtime‑2 и два новых голосовых варианта, доступных только через API

23 hardware

OpenAI расширяет возможности голосового API

Компания объявила о запуске новых функций для своего API, которые позволят разработчикам создавать более «живые» голосовые приложения: они смогут говорить с пользователями, транскрибировать речь в текст и переводить разговоры на лету.


Новые модели Realtime

Через интерфейс Realtime теперь доступны три модели:

МодельНазначениеКлючевые особенности
GPT‑Realtime‑2Голосовое взаимодействие в реальном времениАнализ запросов, вызов инструментов, обработка исправлений и плавное продолжение диалога. Основана на логике GPT‑5, что позволяет обрабатывать более сложные задачи по сравнению с GPT‑Realtime‑1.5.
GPT‑Realtime‑TranslateПеревод в реальном времениПоддерживает 70+ языков ввода и 13 языков вывода. Сохраняет смысл даже при смене контекста, региональных акцентов или специализированной терминологии.
GPT‑Realtime‑WhisperТранскрипция речиПотоковая модель с низкой задержкой, превращающая аудио в текст почти мгновенно.

> «Наши новые модели переводят аудио в реальном времени из простого диалога в голосовые интерфейсы, которые действительно могут работать: слушать, рассуждать, переводить, транскрибировать и предпринимать действия по мере развития разговора», — заявила компания.


Стоимость

МодельЦена
GPT‑Realtime‑2$32 за 1 млн входных аудиотокенов, $0.40 за 1 млн кешированных токенов и $64 за 1 млн выходных аудиотокенов
GPT‑Realtime‑Translate$0.034 в минуту
GPT‑Realtime‑Whisper$0.017 в минуту

Как попробовать

Разработчики могут протестировать новые модели на онлайн-платформе OpenAI Playground и сразу увидеть, как они работают в реальном времени.

Комментарии (0)

Оставьте отзыв — пожалуйста, будьте вежливы и по теме.

Пока нет комментариев. Оставьте комментарий — поделитесь своим мнением!

Чтобы оставить комментарий, войдите в аккаунт.

Войти, чтобы комментировать