В новом руководстве по AugLy представлен подход к многомодальной аугментации данных, охватывающий изображения, текст и аудио. Авторы акцентируют внимание на решении проблем совместимости зависимостей и создании детерминированных синтетических наборов данных, что позволяет проводить воспроизводимые эксперименты.
В ходе работы исследуются функциональные и классовые API AugLy, а также возможности отслеживания интенсивности, вероятностной композиции и трансформаций, учитывающих ограничивающие рамки. Также рассматриваются практические эксперименты по оценке устойчивости, включая бенчмаркинг обнаружения копий изображений и оценку классификаторов текста против атак с использованием помех и обфускации.
Данный подход важен для разработки более устойчивых моделей машинного обучения, так как он позволяет интегрировать аугментацию аудио и создавать запрашиваемый метаданных, что улучшает взаимодействие с наборами данных и DataLoaders в PyTorch. Это может значительно повысить качество и надежность моделей в различных приложениях.