Синтез речи на примере аудиокниги: модель сохраняет стабильность на длинных текстах
Эксперимент по синтезу речи показал, что современные модели способны качественно озвучивать тексты продолжительностью до двух часов, при этом основные проблемы возникают не в самой модели, а в вспомогательных процессах.
Отечественные исследователи провели масштабное тестирование системы синтеза речи, озвучив с её помощью роман «Merdiven» Шамиля Алядина, что заняло почти два часа непрерывного звучания. Целью было выяснить, как нейросеть справляется с длинными текстами по сравнению с короткими тестовыми фразами.
Выяснилось, что сама модель синтеза речи стабильно работает на протяжении всего двухчасового аудио. Большинство ошибок и сбоев были связаны с "обвязкой" — процессами подготовки текста, такими как нарезка на предложения, склейка коротких фраз, удаление нежелательных звуков (вдохов) и извлечение текста из книги. Также сложности вызывала временная разметка.


Комментарии (0)
Без регистрации. Комментарии проверяются автоматически перед публикацией.
Пока нет комментариев. Будьте первым!