1 октября 2026 года Microsoft представила MAI-Transcribe-2-Streaming, свою первую модель распознавания речи в реальном времени. Она стала частью линейки моделей MAI, в которую также вошли MAI-Voice-2.1 и MAI-Voice-2.1-Flash. По данным Artificial Analysis, MAI-Transcribe-2-Streaming занимает первое место среди 38 моделей по точности финальных и первых частичных транскрипций.
MAI-Transcribe-2-Streaming предназначена для использования в голосовых агентах, живых субтитрах и диктовке, где задержка критически важна для пользовательского опыта. Модель поддерживает 60 языков с автоматическим определением языка, что позволяет ей обрабатывать аудиопотоки в реальном времени. Первые гипотезы, называемые частичными транскрипциями, появляются всего через 100 миллисекунд после получения аудиосигнала.
Запуск MAI-Transcribe-2-Streaming подчеркивает стремление Microsoft к инновациям в области искусственного интеллекта и обработки естественного языка. Эта модель может значительно улучшить взаимодействие пользователей с голосовыми интерфейсами, позволяя им получать более точные и быстрые транскрипции, что, в свою очередь, может повысить эффективность работы в различных сферах, включая образование и бизнес.