Meta Superintelligence Labs анонсировала Muse Voice Transcribe, модель, которая объединяет три ключевых функции: автоматическую транскрипцию речи, диаризацию для более чем 20 спикеров и определение окончания речи. Это позволяет избежать задержек и потенциальных ошибок, возникающих при использовании нескольких систем. Muse Voice Transcribe представляет собой первую в Meta модель для восприятия аудио в реальном времени.
Модель работает на основе авторегрессионного подхода и обрабатывает аудио в 80-миллисекундных чанках с частотой 12.5 Гц. Она доступна как хостируемый API на платформе Meta Model API по цене $3.00 за 1,000 минут аудио. В настоящее время Muse Voice Transcribe уже используется в таких приложениях, как Meta AI для Mac и Muse Code.
Внедрение Muse Voice Transcribe может значительно улучшить качество обработки аудио в реальном времени, что важно для различных приложений, включая голосовые помощники и системы автоматической транскрипции. Это также может повлиять на развитие технологий в области искусственного интеллекта и обработки естественного языка, предоставляя пользователям более эффективные инструменты для работы с аудиоинформацией.