Компания Gradium AI выпустила новую модель текстового синтеза речи (TTS), которая теперь является стандартной в ее API и Studio. Модель продемонстрировала 81,0% успешных результатов по оценке на 500 предложениях в сложных случаях, что превышает показатели конкурентов, таких как Cartesia Sonic 3.6 и ElevenLabs v3 Conversational.
Время до первого звука новой модели составляет 216 мс, что на 170 мс быстрее, чем у предыдущей версии. Gradium AI заявляет, что новая модель доступна для развертывания без необходимости миграции, и существующие голоса, включая пользовательские клоны, продолжают работать без изменений.
Эта модель была протестирована на наборе из 500 предложений, охватывающем пять языков, и открыта для использования на платформе Hugging Face. Внедрение этой технологии может значительно улучшить качество взаимодействия голосовых агентов с пользователями, особенно в критически важных моментах, таких как передача заказа или контактной информации.