Модель Qwen-Audio-3.0-TTS, разработанная Alibaba, привлекла внимание благодаря своим высоким показателям в области синтетической речи. В бенчмарке SEED-TTS-Eval результаты синтетической речи были сопоставлены с живой человеческой речью, что позволяет оценить уровень разборчивости и естественности синтетических голосов.
Автор статьи, работающий ML-инженером в аудиодомене, отмечает, что результаты Qwen-Audio-3.0-TTS показывают значительные улучшения по сравнению с предыдущими версиями. В таблице результатов присутствует строка с живой речью, что создает контекст для сравнения и подчеркивает достижения синтетических технологий.
Эти исследования важны для развития технологий генерации речи, поскольку они помогают понять, насколько близки синтетические голоса к естественным. Улучшение качества синтетической речи может значительно повлиять на различные области, включая образование, развлечения и взаимодействие с пользователями в цифровых сервисах.