В соответствии с новым законодательством Европейского Союза, платформы искусственного интеллекта начинают внедрять технологии водяных знаков для контроля генерируемого контента. Компания Anthropic сообщила, что её будущие модели Claude будут использовать SynthID-Text, метод, разработанный Google и выпущенный в открытый доступ. Данная технология применяет секретный ключ, который изменяет процесс выбора следующего слова в предложении, что позволяет идентифицировать источник контента.
Исследования показывают, что SynthID-Text может не только изменять выбор слов, но и влиять на инструменты, которые использует модель, а также на вероятность соблюдения или игнорирования установленных ею ограничений безопасности. Это становится особенно актуальным в условиях, когда злоумышленники пытаются заставить модель выполнять опасные действия, такие как раскрытие паролей или другой конфиденциальной информации.
Внедрение таких технологий подчеркивает важность обеспечения безопасности и надежности систем ИИ, особенно в свете растущих угроз и требований к прозрачности. Использование водяных знаков может стать ключевым элементом в борьбе с потенциальными злоупотреблениями и повысить доверие пользователей к платформам искусственного интеллекта.