Google представила новую модель распознавания речи Gemini 3.5 Transcribe, которая обеспечивает среднюю ошибку слов (WER) в 2.6% для нестримингового контента и 4.0% для стриминга. Модель предназначена для использования в реальном времени и для обработки записанных аудио, предлагая два отдельных API: Interactions API для предварительно записанных файлов и Live API для двунаправленного стриминга.
Одним из ключевых улучшений Gemini 3.5 является сокращение времени на финальную транскрипцию на 70% по сравнению с предыдущей моделью Chirp 3. Также новая модель автоматически распознает более 85 языков, включая возможность переключения языков в середине предложения, что делает ее более универсальной для многоязычных пользователей.
Данная модель доступна только через API и не предоставляет открытых весов для самостоятельного хостинга. Это решение ориентировано на управление сервисом, что может быть удобно для разработчиков и стартапов, которые могут начать с бесплатного уровня API через Google AI Studio.