Согласно последнему сообщению, совместная работа AWS и NVIDIA привела к снижению затрат на автоматическое распознавание речи (ASR) на 75% с использованием NVIDIA MPS на Amazon EC2. Это особенно актуально, когда использование графических процессоров на запрос низкое, но требования к задержке остаются строгими. Обычно один запрос ASR использует только 15-20% вычислительных мощностей графического процессора, оставляя 80% оборудования неиспользуемым.
Heidi Health, AI-партнер в области здравоохранения, обрабатывает более 2,4 миллиона клинических консультаций в неделю в 190 странах. Для поддержания задержки транскрипции менее одной секунды в условиях пиковых нагрузок компании необходимо запускать 16 экземпляров графических процессоров. В предыдущих публикациях рассматривались методы настройки модели Nemotron для клинического распознавания речи, а теперь акцент сделан на эффективном обслуживании этой модели.
Внедрение NVIDIA CUDA Multi-Process Service (MPS) позволяет значительно улучшить производительность и снизить затраты, что может привести к более широкому применению технологий ASR в различных областях. Это решение не только оптимизирует использование ресурсов, но и способствует улучшению качества обслуживания клиентов в здравоохранении и других сферах.