Xiaomi запустила OmniVoice — открытая модель ИИ, способная озвучивать тексты практически на всех языках и копировать голоса.

Xiaomi запустила OmniVoice — открытая модель ИИ, способная озвучивать тексты практически на всех языках и копировать голоса.

18 software

Xiaomi представила открытый ИИ‑модуль OmniVoice

Компания объявила о запуске модели искусственного интеллекта OmniVoice, которая преобразует текст в речь. Помимо синтеза голоса на сотнях языков, модель умеет клонировать голос и генерировать произношение с пользовательскими настройками.


Что нового в OmniVoice?

ПоказательОписание
ЯзыкиПоддержка более 200 языков, включая редкие и малообучаемые. Даже при наличии менее 10 часов данных модель выдаёт речь «почти на любом языке».
КачествоВ тестах по 102 языкам разборчивость речи была сопоставима с человеческой, а в некоторых случаях превосходила её. На 24 языках модель обогнала несколько коммерческих систем по сходству и разборчивости.
АрхитектураУпрощённая двунаправленная трансформер‑сеть без промежуточных модулей прогнозирования токенов. Это сокращает время обучения до одного дня на 100 000 часов данных и повышает скорость инференса (до 40× реального времени в PyTorch).
Технологии• «Случайное скрытие акустических кодов» – ускоряет обучение.
• Подключение большой языковой модели при предварительном обучении улучшает произношение и разборчивость.

Практические возможности

1. Клонирование голоса
- Генерация речи по описанным характеристикам (возраст, пол, тон, акцент, диалект).
- Возможность создания шёпота и других стилистических вариантов без эталонного аудио.

2. Обработка исходных записей
- Удаление шума и извлечение чистых характеристик голоса даже из неидеальных файлов.

3. Управление интонацией
- Добавление вздохов, смеха и других нюансов для более естественного звучания.

4. Точная коррекция произношения
- Ручная настройка сложных звуков, например многозвучных китайских иероглифов или англоязычных собственных имён.


Итоги

OmniVoice представляет собой конкурентоспособную альтернативу существующим коммерческим системам синтеза речи. Благодаря простому дизайну, высокой скорости обучения и инференса, а также широким возможностям кастомизации, модель готова к интеграции в потребительские приложения и сервисы.

Комментарии (0)

Оставьте отзыв — пожалуйста, будьте вежливы и по теме.

Пока нет комментариев. Оставьте комментарий — поделитесь своим мнением!

Чтобы оставить комментарий, войдите в аккаунт.

Войти, чтобы комментировать