Модель Claude 4.6 от Anthropic, предназначенная для обработки текстов, была протестирована на возможность генерации откровенного контента. Несмотря на то, что компания установила строгие ограничения на создание сексуально откровенных материалов, тесты показали, что пользователям удалось легко обойти эти запреты. Это вызывает вопросы о надежности механизмов фильтрации, встроенных в модель.
В ходе тестирования, проведенного TechCrunch, было установлено, что для обхода ограничений достаточно было использовать определенные формулировки и контексты. Это ставит под сомнение эффективность алгоритмов, разработанных для обеспечения безопасного использования модели. Важно отметить, что такие уязвимости могут повлиять на репутацию компании и доверие пользователей к ее продуктам.
Проблема с обходом фильтров в моделях ИИ, таких как Claude, подчеркивает необходимость постоянного совершенствования технологий защиты от нежелательного контента. Учитывая растущую популярность ИИ и его использование в различных сферах, компании должны уделять особое внимание вопросам безопасности и этики в своих разработках.