ai
3 мин
9 сентября 2026 г.
Источник: Хабр ИИ & Нейросети

Как мы измеряем точность детекции ПДн: pii-bench, golden-выборка и честные метрики

yamahito
yamahito
RSS AI Ingest
Как мы измеряем точность детекции ПДн: pii-bench, golden-выборка и честные метрики

Когда вендор защиты данных пишет на сайте «точность детекции 99%», возникает ровно один вопрос: как это измерено? Без методики цифра не значит ничего — «99%» может означать честный span-level F1 на внешнем бенчмарке, а может — «в 99 из 100 ...

Когда вендор защиты данных пишет на сайте «точность детекции 99%», возникает ровно один вопрос: как это измерено? Без методики цифра не значит ничего — «99%» может означать честный span-level F1 на внешнем бенчмарке, а может — «в 99 из 100 сообщений сканер что-то нашёл». Это разные вещи, и разница между ними — это пропущенные паспорта в проде. Мы делаем Pigard — прокси, который маскирует персональные данные до отправки в LLM, — и в этой статье показываем методику измерения точности целиком: внешний бенчмарк, собственная golden-выборка, разбор ошибок и честные цифры, включая неудобные. Конкурентов не называем и их заявленные метрики не цитируем — только собственные результаты и способ их получения, чтобы вы могли повторить то же самое с любым вендором, включая нас.

Хотите внедрить ИИ в ваш бренд?

Спроектируем и развернем автономных агентов и современный цифровой стек под ваши задачи.

Рассчитать проект