vestka

Microsoft представила MAI-Transcribe-2-Streaming: новый модель для распознавания речи в реальном времени

1 октября 2026 года Microsoft представила MAI-Transcribe-2-Streaming, свою первую модель распознавания речи в реальном времени. Она стала частью линейки моделей MAI, в которую также вошли MAI-Voice-2.1 и MAI-Voice-2.1-Flash. По данным Artificial Analysis, MAI-Transcribe-2-Streaming занимает первое место среди 38 моделей по точности финальных и первых частичных транскрипций.

MAI-Transcribe-2-Streaming предназначена для использования в голосовых агентах, живых субтитрах и диктовке, где задержка критически важна для пользовательского опыта. Модель поддерживает 60 языков с автоматическим определением языка, что позволяет ей обрабатывать аудиопотоки в реальном времени. Первые гипотезы, называемые частичными транскрипциями, появляются всего через 100 миллисекунд после получения аудиосигнала.

Запуск MAI-Transcribe-2-Streaming подчеркивает стремление Microsoft к инновациям в области искусственного интеллекта и обработки естественного языка. Эта модель может значительно улучшить взаимодействие пользователей с голосовыми интерфейсами, позволяя им получать более точные и быстрые транскрипции, что, в свою очередь, может повысить эффективность работы в различных сферах, включая образование и бизнес.

Главное

  • MAI-Transcribe-2-Streaming была выпущена 1 октября 2026 года.
  • Модель поддерживает 60 языков с автоматическим определением языка.
  • По данным Artificial Analysis, модель занимает первое место среди 38 аналогичных решений по точности транскрипций.

Упомянуто

Важное из дайджеста

Открыть полный дайджест →