Sarvam AI представила новую модель распознавания речи Saaras V4, которая охватывает все 22 официальных индийских языка и английский с учетом различных акцентов. Модель обеспечивает современную точность и доступна для использования через API Sarvam, что позволяет разработчикам интегрировать её в свои приложения.
Saaras V4 основана на системе кодировщика-декодировщика. Аудиокодировщик преобразует звуковую волну в эмбеддинги, которые содержат фонетическую и акустическую информацию. Затем адаптер для временного уменьшения длины сокращает последовательность и проецирует её в пространство эмбеддингов языковой модели, что позволяет обрабатывать длинные записи.
Эта модель важна для расширения доступности технологий распознавания речи в многоязычных странах, таких как Индия, где разнообразие языков является значительным. Внедрение Saaras V4 может улучшить взаимодействие пользователей с технологиями и повысить качество автоматизированного перевода и транскрипции.