В исследовании, опубликованном 6 октября 2026 года, рассматривается маскирование персональных данных (ПДн) для языковых моделей (LLM). Ученые протестировали шесть шлюзов маскирования ПДн с использованием живого агента и инструментов, чтобы измерить, возвращается ли настоящее значение в аргумент вызова, что не учитывается в существующих бенчмарках.
Авторы работы выделили четыре ключевые находки, которые могут оказать значительное влияние на методы обработки данных в контексте языковых моделей. Эти находки помогают лучше понять, как маскирование ПДн влияет на производительность моделей и какие аспекты остаются незамеченными в текущих подходах.
Данное исследование имеет важное значение для дальнейшего развития технологий обработки данных и повышения уровня конфиденциальности. Открытый корпус данных, представленный в работе, может стать основой для будущих исследований и улучшения существующих методов маскирования ПДн в LLM.