Amazon SageMaker анонсировал развертывание модели Qwen3-TTS-12Hz-1.7B-Base, которая позволяет создавать персонализированный синтез речи в реальном времени. С помощью технологии клонирования голоса, пользователи могут генерировать новую речь в голосе целевого спикера, используя короткую эталонную запись без необходимости повторного обучения модели.
Эта возможность будет полезна для медиа-команд, педагогов и разработчиков приложений, позволяя им создавать персонализированные голосовые интерфейсы и локализовать многоязычный контент. Клонирование голоса помогает поддерживать доступную коммуникацию и сохранять идентичность спикера при переводе на другие языки.
С помощью модели, доступной для самостоятельного хостинга, пользователи могут контролировать затраты и хранить аудиоданные в своем AWS-окружении. Кроме того, модель можно адаптировать под конкретные домены, что расширяет ее применение в различных сферах.