SpaceXAI анонсировала выпуск Grok Voice Transcribe 2.0, нового API для преобразования речи в текст, который, как утверждается, обладает удвоенной точностью по сравнению с предыдущей версией. Модель ориентирована на обработку сложных аудиосигналов, таких как шумные телефонные линии и конкурирующие голоса, и доступна в режиме пакетной обработки и реального времени через API.
Grok Voice Transcribe 2.0 построен на основе аудиофонда, используемого в Grok Voice, который уже обрабатывает десятки тысяч звонков службы поддержки ежедневно и транскрибирует миллионы часов видео. Обучение модели проводилось на многозначных, шумных аудиозаписях, собранных в различных условиях, что позволяет ей эффективно справляться с различными акцентами и фоновым шумом.
Важность данного релиза заключается в том, что Grok Voice Transcribe 2.0 может значительно улучшить качество автоматического распознавания речи в сложных условиях, что, в свою очередь, расширяет возможности применения технологий искусственного интеллекта в бизнесе и повседневной жизни. Модель уже доступна для использования под идентификатором grok-voice-transcribe-2.0, однако SpaceXAI не предоставляет открытых весов для самостоятельного хостинга.