Google представил новые модели текст-в-речь Gemini 3.8 Flash TTS и Flash-Lite TTS, которые стали частью семейства Gemini Audio. Flash TTS ориентирован на креативное направление и озвучивание персонажей, в то время как Flash-Lite TTS предназначен для высокообъемного и экономически эффективного производства. Обе модели позволяют разработчикам управлять доставкой текста построчно с использованием естественного языка.
Flash TTS предлагает детальный контроль над актёрскими подсказками, ритмом, акцентами и обратной связью, что делает его подходящим для игровых приложений, интерактивных медиа и подкастов. Flash-Lite TTS, в свою очередь, обеспечивает более быстрый и доступный способ генерации речи, что может быть полезно для массового производства контента. Оба решения доступны через API Gemini и Google AI Studio, но открытые веса для самостоятельного хостинга отсутствуют.
Введение этих моделей может значительно повлиять на индустрию разработки контента, предоставляя новые инструменты для создания более выразительного и интерактивного аудио. Это также может ускорить процесс разработки и снизить затраты на создание аудиоконтента, что важно для многих компаний в сфере медиа и развлечений.