Что такое PII? Виды, примеры и чем это отличается от персональных данных
PII (информация, позволяющая идентифицировать человека) — это любые сведения, по которым можно установить конкретного человека: сами по себе, как номер паспорта, или в сочетании с другими данными, как почтовый индекс вместе с датой рождения. Американский стандарт NIST SP 800-122 описывает их в двух частях: информация, которая выделяет личность или позволяет её отследить, и любая другая информация, связанная или способная быть связанной с этим человеком.
Что считается PII? Официальное определение
Единого закрытого списка не существует — состав PII зависит от юрисдикции. Наиболее часто цитируемое определение из США дано в NIST Special Publication 800-122, где PII делится на (1) информацию, по которой можно выделить личность человека или отследить её, — имя, номер социального страхования, дата и место рождения, девичья фамилия матери или биометрические записи — и (2) любую другую информацию, связанную или способную быть связанной с человеком, например медицинские, образовательные, финансовые данные или сведения о занятости. (Источник: NIST SP 800-122.) Именно критерий «связана или может быть связана» здесь ключевой: чтобы считаться PII, данные не обязаны называть человека — достаточно того, что они помогают его идентифицировать.
Виды PII с примерами
NIST группирует PII по следующим примерным категориям (это иллюстрация, а не исчерпывающий перечень):
| Категория | Примеры |
|---|---|
| Имена | Полное имя, девичья фамилия, девичья фамилия матери, псевдоним |
| Идентификационные номера | Номер соцстрахования (SSN), паспорт, водительское удостоверение, ИНН, идентификатор пациента, финансовый номер или номер платёжной карты |
| Адресные данные | Почтовый адрес или адрес электронной почты |
| Идентификаторы активов и онлайн-идентификаторы | IP-адрес, MAC-адрес, файлы cookie и идентификаторы устройств |
| Номера телефонов | Мобильный, стационарный, факс |
| Персональные характеристики | Фотография лица, отпечатки пальцев, снимок сетчатки глаза, голосовой слепок и другие биометрические данные |
| Идентификаторы имущества | Регистрационный номер транспортного средства или свидетельство о праве собственности, серийный номер устройства |
Категории по NIST SP 800-122 §2.2. Occlira распознаёт 40+ типов таких данных в документах, таблицах, электронной почте, аудио и изображениях.
Прямые идентификаторы, косвенные идентификаторы и квазиидентификаторы
Специалисты по защите приватности классифицируют PII по тому, как именно данные идентифицируют человека, — это разделение лежит в основе большинства схем классификации:
- Прямые идентификаторы выделяют человека сами по себе — паспорт или SSN, адрес электронной почты, номер телефона.
- Косвенные (квази-) идентификаторы по отдельности никого не идентифицируют, но идентифицируют в сочетании. Пример из самого NIST: список кредитных рейтингов не идентифицирует никого, но стоит добавить возраст, адрес и пол — и люди становятся идентифицируемыми. (Источник: NISTIR 8053.)
Классическая демонстрация принадлежит Латани Суини: она повторно идентифицировала «обезличенную» медицинскую запись губернатора США всего по трём полям — дате рождения, почтовому индексу и полу — и оценила, что эти же три поля однозначно идентифицируют примерно 87 % населения США (более позднее повторение исследования дало значение около 63 %). (Источник: Golle 2006, со ссылкой на Sweeney.) Именно поэтому удалить очевидные имена мало: оставшиеся квазиидентификаторы могут повторно идентифицировать людей, а значит, надёжное скрытие данных должно улавливать и то, и другое.
PII, персональные данные и PHI
| Термин | Правовая база | Объём | Пример |
|---|---|---|---|
| PII (информация, идентифицирующая человека) | Практика США (например, NIST SP 800-122) | Информация, которая выделяет конкретного человека или позволяет его отследить, а также всё, что связано или может быть связано с ним | SSN, имя, адрес электронной почты, IP-адрес |
| Personal data (персональные данные) | GDPR ЕС и Великобритании, ст. 4(1) | Любая информация, относящаяся к идентифицированному или идентифицируемому лицу, прямо или косвенно; онлайн-идентификаторы включены напрямую | Имя, данные о местоположении, идентификатор cookie, IP-адрес |
| PHI (защищаемая медицинская информация) | HIPAA (США) | Сведения о здоровье, связанные с одним из 18 идентификаторов и хранящиеся у подпадающей под закон организации | Диагноз рядом с именем или номером медицинской карты |
Эти три понятия во многом пересекаются, а практическая задача одна и та же — найти идентификаторы и удалить их. Основное различие — в широте охвата: GDPR ст. 4(1) охватывает всех, кого можно идентифицировать «прямо или косвенно», а Recital 30 прямо разъясняет, что онлайн-идентификаторы — IP-адреса, идентификаторы cookie, метки RFID — являются персональными данными. Поэтому GDPR заметно шире классического американского понятия PII.
Чувствительные и нечувствительные PII (и особые категории данных GDPR)
Не все PII несут одинаковый риск, поэтому их удобно разделить на две группы:
- Чувствительные PII способны причинить реальный вред при раскрытии и требуют самой надёжной защиты — национальные удостоверения личности, финансовые и платёжные данные, медицинские записи, биометрия и точное местоположение.
- Нечувствительные PII часто общедоступны или сами по себе менее рискованны — имя, должность или рабочий адрес электронной почты — и становятся опасными в основном тогда, когда сочетаются с другими полями.
В GDPR предусмотрен более строгий, прямо поименованный уровень — особые категории данных, обработка которых по умолчанию запрещена (ст. 9): данные, раскрывающие расовое или этническое происхождение, политические взгляды, религиозные или философские убеждения, членство в профсоюзе, генетические данные, биометрические данные для однозначной идентификации человека, сведения о здоровье, а также данные о половой жизни или сексуальной ориентации. «Особая категория» — термин GDPR; «чувствительные PII» — более размытый американский аналог.
18 идентификаторов HIPAA (метод Safe Harbor)
Для медицинских данных в США существует самый конкретный перечень того, что считается идентификатором. Чтобы обезличить запись по методу Safe Harbor из HIPAA, подпадающая под закон организация должна удалить все 18 идентификаторов и не располагать сведениями о том, что оставшаяся информация всё ещё могла бы идентифицировать человека: (Источник: 45 CFR 164.514(b)(2).)
- Имена
- Географические данные мельче уровня штата (не считая первых 3 цифр почтового индекса ZIP, и только если в соответствующем районе проживает более 20 000 человек)
- Все даты, кроме года (рождения, поступления, выписки, смерти); возраст старше 89 лет объединяется в группу «90 лет и старше»
- Номера телефонов
- Номера факсов
- Адреса электронной почты
- Номера социального страхования (SSN)
- Номера медицинских карт
- Номера участников плана медицинского страхования
- Номера счетов
- Номера сертификатов и лицензий
- Идентификаторы транспортных средств и номерные знаки
- Идентификаторы устройств и серийные номера
- Веб-адреса (URL)
- IP-адреса
- Биометрические идентификаторы, в том числе отпечатки пальцев и голосовые слепки
- Фотографии лица анфас и сопоставимые изображения
- Любой другой уникальный идентификационный номер, признак или код
Второй путь HIPAA, Expert Determination (заключение эксперта), вместо этого требует, чтобы квалифицированный эксперт подтвердил, что риск повторной идентификации «очень мал», — это стандарт остаточного риска, а не заявление о его полном отсутствии. (Источник: HHS.)
Анонимизация, псевдонимизация и скрытие данных
Эти три понятия часто путают, но закон относится к ним совершенно по-разному:
| Метод | Обратим? | Остаются ли персональными данными? | Цель |
|---|---|---|---|
| Скрытие (редактирование) | Данные удаляются или закрашиваются | Удалены из этого документа | Убрать идентификаторы из файла, прежде чем им делиться |
| Псевдонимизация | Обратима при наличии отдельно хранимой таблицы соответствий | Да — по-прежнему персональные данные (GDPR ст. 4(5)) | Снизить риск, сохранив данные пригодными к работе и восстановлению |
| Анонимизация | Необратима — повторно идентифицировать человека невозможно | Нет — вне действия GDPR, если данные действительно анонимны (Recital 26) | Исключить возможность повторной идентификации |
Это различие имеет прямые правовые последствия. Согласно GDPR ст. 4(5), псевдонимизированные данные — обратимые при наличии отдельно хранимой информации — по-прежнему являются персональными данными; и только действительно анонимные данные (Recital 26) выходят за рамки GDPR. Руководство EDPB по псевдонимизации 2025 года это подтверждает: обратимая токенизация снижает риск, но оставляет данные в сфере действия закона.
Почему удаления имён недостаточно
Даже тщательное обезличивание оставляет некоторый остаточный риск. Проверка метода HIPAA Safe Harbor показала, что менее 1 % записей удавалось повторно идентифицировать, когда оставались только год рождения, пол и 3-значный почтовый индекс, — мало, но не ноль. (Источник: NISTIR 8053.) В сочетании с цифрой Суини в 87 % вывод остаётся неизменным: убрать имена — самое простое; настоящая работа в том, чтобы уловить косвенные идентификаторы, которые незаметно выделяют людей, — а именно это и должен делать хороший инструмент скрытия данных, а не просто сопоставлять имена.
Как удалить PII из ваших файлов — локально
Когда вы знаете, что искать, самый безопасный способ удалить эти данные — вести всю работу на собственном компьютере. Occlira — это настольное приложение для Windows и macOS, которое распознаёт и удаляет 40+ типов PII — имена, национальные удостоверения личности, адреса электронной почты, финансовые идентификаторы, медицинские данные и прочее — в документах, таблицах, электронной почте, аудио и изображениях, полностью на устройстве, без облака и без учётной записи. Оно помечает не только имена, но и косвенные идентификаторы, а значит, закрывает описанный выше пробел с повторной идентификацией.
Его обезличивание обратимо: каждый идентификатор заменяется нейтральной подстановкой, а таблица соответствий хранится на вашем устройстве, поэтому исходные значения можно восстановить. В терминах GDPR это псевдонимизация — серьёзный шаг по снижению риска, но, как сказано выше, результат по-прежнему является персональными данными, поэтому воспринимайте его как минимизацию данных, а не как способ выйти из-под правил. Пошаговые инструкции см. в материалах обезличивание перед ChatGPT и как скрыть данные в Word, PDF и Excel.
Часто задаваемые вопросы
PII (personally identifiable information — информация, позволяющая идентифицировать человека) — это любые сведения, по которым можно установить конкретного человека, сами по себе или в сочетании с другими данными. NIST определяет их в двух частях: информация, которая выделяет личность или позволяет её отследить (имя, SSN, дата и место рождения, биометрия), и любая другая информация, связанная или способная быть связанной с этим человеком (медицинские, финансовые данные, сведения о занятости или образовании).
«PII» — распространённый термин в США; «personal data» — термин GDPR, и он шире: он охватывает всё, что относится к идентифицируемому лицу прямо или косвенно, и напрямую включает онлайн-идентификаторы, такие как IP-адреса и идентификаторы cookie. Почти всё, что относится к PII, одновременно является и персональными данными; GDPR просто трактует их шире.
PHI (protected health information — защищаемая медицинская информация) — это часть понятия из закона HIPAA: сведения о здоровье, связанные с одним из 18 конкретных идентификаторов и хранящиеся у подпадающей под закон организации, например у больницы или плана медицинского страхования. Любая PHI относится к PII, но значительная часть PII (скажем, рабочий адрес электронной почты) к PHI не относится.
Да. Адрес электронной почты указывает на конкретного человека — особенно рабочий адрес, построенный на имени, — поэтому в США он считается PII, а по GDPR — персональными данными.
По GDPR — да: Recital 30 относит IP-адреса к онлайн-идентификаторам, которые делают человека идентифицируемым, а значит, это персональные данные. В США IP-адрес исторически считали персональными данными только в сочетании с другими сведениями, но всё чаще относят к ним и сам по себе.
Прямой идентификатор выделяет человека сам по себе (SSN, номер паспорта, адрес электронной почты). Косвенные, или квазиидентификаторы, по отдельности никого не идентифицируют, но идентифицируют в сочетании — дата рождения, почтовый индекс, пол, должность. NIST приводит пример: список кредитных рейтингов не идентифицирует никого, но стоит добавить возраст, адрес и пол — и люди становятся идентифицируемыми.
Псевдонимизация заменяет идентификаторы обратимыми подстановками, пока таблица соответствий хранится отдельно, — и согласно GDPR ст. 4(5) результат по-прежнему является персональными данными. Анонимизация же нацелена на то, чтобы сделать повторную идентификацию невозможной; только в этом случае (Recital 26) данные выходят за рамки GDPR. Руководство EDPB по псевдонимизации 2025 года подтверждает, что псевдонимизированные данные остаются в сфере действия закона.
Да. Поскольку их можно снова соотнести с человеком по отдельно хранимой дополнительной информации, псевдонимизированные данные остаются персональными данными по GDPR. Это снижает риск и обеспечивает обратимость, но это не то же самое, что анонимизация.
Часто да. Знаковое исследование Латани Суини показало, что около 87 % населения США однозначно идентифицируются по почтовому индексу, полной дате рождения и полу; более позднее повторение исследования дало значение около 63 %. Именно поэтому для анонимизации набора данных недостаточно удалить одни лишь имена — квазиидентификаторы всё равно способны выделить конкретных людей.
Находите и удаляйте PII локально
Распознавайте и удаляйте персональные данные в своих файлах прямо на собственном компьютере. 14 дней бесплатно на Windows и macOS.
Ещё: как использовать ИИ, не нарушая GDPR · удаление персональных данных из аудио · как обрабатываются ваши данные