Alibaba представила Qwen-Audio-3.1, новый голосовой модельный стек, который включает в себя пять моделей, охватывающих автоматическое распознавание речи (ASR), синтез речи (TTS) и взаимодействие в реальном времени. Основная модель, Qwen-Audio-3.1-Realtime, представляет собой полно-дуплексную модель, предназначенную для голосовых агентов, способных вызывать инструменты. В рамках релиза также произошло значительное снижение цен: на Realtime — около 85%, на TTS — около 70%, а на ASR — до 95%.
Модель доступна через управляемый API на платформе QwenCloud, где пользователи могут взаимодействовать с текстом и аудио как входными и выходными данными. Контекст модели составляет 262K токенов, с максимальным входом 245K и выходом 16K токенов. Стандартные лимиты включают 60 запросов и 100K токенов в минуту, а стоимость использования составляет $6.4 за 1M аудиовходных токенов и $0.8 за 1M текстовых токенов.
Релиз Qwen-Audio-3.1 имеет большое значение для рынка голосовых технологий, так как предлагает новые возможности для разработчиков и компаний, желающих интегрировать голосовые интерфейсы в свои продукты. Снижение цен на услуги делает технологии более доступными, что может способствовать их более широкому распространению и внедрению в различных отраслях.