¿Qué es la PII? Tipos, ejemplos y en qué se diferencia de los datos personales
La PII (información de identificación personal) es cualquier información que puede identificar a una persona concreta: por sí sola, como un número de pasaporte, o combinada con otros datos, como un código postal junto a una fecha de nacimiento. El estándar estadounidense, NIST SP 800-122, la plantea en dos partes: la información que distingue o permite rastrear una identidad, más cualquier otra información vinculada o vinculable a esa persona.
¿Qué se considera PII? La definición oficial
No existe una única lista cerrada: lo que cuenta depende de la jurisdicción. La definición estadounidense más citada procede de la Publicación Especial 800-122 del NIST, que divide la PII en (1) información que puede usarse para distinguir o rastrear la identidad de una persona —un nombre, un número de la Seguridad Social, la fecha y el lugar de nacimiento, los apellidos de soltera de la madre o registros biométricos— y (2) cualquier otra información que esté vinculada o sea vinculable a una persona, como datos médicos, educativos, financieros o laborales. (Fuente: NIST SP 800-122.) Ese criterio de «vinculado o vinculable» es la idea clave: un dato no tiene que nombrar a alguien para ser PII; basta con que ayude a identificarlo.
Tipos de PII, con ejemplos
El NIST agrupa la PII en estas categorías de ejemplo (es una lista ilustrativa, no exhaustiva):
| Categoría | Ejemplos |
|---|---|
| Nombres | Nombre completo, apellidos de soltera, apellidos de soltera de la madre, alias |
| Números de identificación personal | Número de la Seguridad Social (SSN), pasaporte, permiso de conducir, número de identificación fiscal, identificador de paciente, número financiero o de tarjeta de crédito |
| Datos de domicilio | Dirección postal o dirección de correo electrónico |
| Identificadores de activos y en línea | Dirección IP, dirección MAC, cookies e identificadores de dispositivo |
| Números de teléfono | Móvil, fijo, fax |
| Características personales | Fotografía del rostro, huellas dactilares, escáner de retina, huella de voz y otros datos biométricos |
| Identificadores de bienes en propiedad | Matrícula o número de título de un vehículo, número de serie de un dispositivo |
Categorías de NIST SP 800-122 §2.2. Occlira detecta 40+ tipos como estos en documentos, hojas de cálculo, correo electrónico, audio e imágenes.
Identificadores directos, identificadores indirectos y cuasiidentificadores
Los equipos de privacidad clasifican la PII según cómo identifica a alguien; es la distinción que subyace a la mayoría de los esquemas de clasificación:
- Los identificadores directos permiten identificar a alguien por sí solos: un pasaporte o un SSN, una dirección de correo electrónico, un número de teléfono.
- Los identificadores indirectos (o cuasiidentificadores) no identifican a nadie de forma aislada, pero sí en combinación. Valga el propio ejemplo del NIST: una lista de puntuaciones de crédito no identifica a nadie, pero, si se le añaden la edad, el domicilio y el sexo, las personas pasan a ser identificables. (Fuente: NISTIR 8053.)
La demostración clásica es la de Latanya Sweeney, que reidentificó la historia clínica «desidentificada» de un gobernador estadounidense empleando únicamente la fecha de nacimiento, el código postal y el sexo, y estimó que esos mismos tres campos identifican de forma unívoca a alrededor del 87 % de la población de EE. UU. (una réplica posterior lo situó cerca del 63 %). (Fuente: Golle 2006, citando a Sweeney.) Por eso no basta con eliminar los nombres evidentes: los cuasiidentificadores restantes pueden reidentificar a las personas, de modo que una buena supresión debe detectar unos y otros.
PII frente a datos personales frente a PHI
| Término | Marco | Alcance | Ejemplo |
|---|---|---|---|
| PII | Práctica de EE. UU. (p. ej. NIST SP 800-122) | Información que distingue o permite rastrear a una persona, más todo lo que esté vinculado o sea vinculable a ella | SSN, nombre, correo electrónico, dirección IP |
| Datos personales | RGPD de la UE/Reino Unido, art. 4.1 | Cualquier información relativa a una persona identificada o identificable, directa o indirectamente; incluye expresamente los identificadores en línea | Nombre, datos de localización, identificador de cookie, dirección IP |
| PHI | HIPAA de EE. UU. | Información sanitaria vinculada a uno de los 18 identificadores y en poder de una entidad obligada | Un diagnóstico junto a un nombre o un número de historia clínica |
Los tres conceptos se solapan en gran medida, y la tarea práctica es idéntica: localizar los identificadores y eliminarlos. La principal diferencia está en el alcance: el art. 4.1 del RGPD abarca a cualquier persona identificable «directa o indirectamente», y el considerando 30 precisa que los identificadores en línea —direcciones IP, identificadores de cookies, etiquetas RFID— son datos personales. Todo ello hace que el RGPD sea notablemente más amplio que la noción clásica estadounidense de PII.
PII sensible frente a no sensible (y las categorías especiales del RGPD)
No toda la PII conlleva el mismo riesgo, por lo que conviene dividirla en dos grupos:
- La PII sensible puede causar un daño real si se expone y merece la máxima protección: identificadores nacionales, datos financieros y de pago, historiales médicos, datos biométricos y localización precisa.
- La PII no sensible suele ser pública o de menor riesgo por sí sola —un nombre, un puesto de trabajo o un correo corporativo— y se vuelve arriesgada sobre todo cuando se combina con otros campos.
El RGPD tiene un nivel más estricto y con nombre propio, las categorías especiales de datos, cuyo tratamiento está prohibido por defecto (art. 9): datos que revelen el origen racial o étnico, las opiniones políticas, las convicciones religiosas o filosóficas, la afiliación sindical, los datos genéticos, los datos biométricos usados para identificar de forma inequívoca a una persona, los datos de salud y los datos relativos a la vida sexual o la orientación sexual de una persona. «Categoría especial» es el término del RGPD; «PII sensible» es el equivalente estadounidense más laxo.
Los 18 identificadores de la HIPAA (Safe Harbor)
Los datos de salud de EE. UU. cuentan con el inventario más concreto de lo que se considera identificador. Para desidentificar un registro con el método Safe Harbor de la HIPAA, una entidad obligada debe eliminar los 18 identificadores y no tener conocimiento efectivo de que la información restante pueda seguir identificando a la persona: (Fuente: 45 CFR 164.514(b)(2).)
- Nombres
- Datos geográficos más precisos que el estado (solo los 3 primeros dígitos del código postal, y solo si la zona tiene más de 20 000 habitantes)
- Todas las fechas salvo el año (nacimiento, ingreso, alta, fallecimiento); las edades superiores a 89 años se agrupan como «90 o más»
- Números de teléfono
- Números de fax
- Direcciones de correo electrónico
- Números de la Seguridad Social
- Números de historia clínica
- Números de beneficiario de un plan de salud
- Números de cuenta
- Números de certificado o de licencia
- Identificadores de vehículos y matrículas
- Identificadores de dispositivo y números de serie
- URL web
- Direcciones IP
- Identificadores biométricos, incluidas las huellas dactilares y las huellas de voz
- Fotografías del rostro completo e imágenes comparables
- Cualquier otro número, característica o código identificativo único
La segunda vía de la HIPAA, la determinación por un experto, exige en cambio que un experto cualificado confirme que el riesgo de reidentificación es «muy pequeño»: un criterio de riesgo residual, no una garantía de riesgo cero. (Fuente: HHS.)
Anonimización frente a seudonimización frente a supresión
Estos tres términos suelen usarse indistintamente, pero la ley los trata de forma muy distinta:
| Técnica | ¿Reversible? | ¿Siguen siendo datos personales? | Objetivo |
|---|---|---|---|
| Supresión | Los datos se eliminan o se tachan | Eliminados de ese documento | Retirar los identificadores de un archivo antes de compartirlo |
| Seudonimización | Reversible: mediante la tabla de correspondencias guardada por separado | Sí: siguen siendo datos personales (RGPD, art. 4.5) | Reducir el riesgo manteniendo los datos utilizables y restaurables |
| Anonimización | Irreversible: no se puede reidentificar a nadie | No: quedan fuera del RGPD si son verdaderamente anónimos (considerando 26) | Hacer imposible la reidentificación |
La distinción tiene peso jurídico. Según el art. 4.5 del RGPD, los datos seudonimizados —reversibles con información guardada por separado— siguen siendo datos personales; solo los datos verdaderamente anónimos (considerando 26) quedan fuera del RGPD. Las directrices de seudonimización de 2025 del CEPD lo confirman: la tokenización reversible reduce el riesgo, pero mantiene los datos dentro del ámbito de aplicación de la norma.
Por qué no basta con eliminar los nombres
Incluso una desidentificación cuidadosa deja cierto riesgo residual. Una prueba del método Safe Harbor de la HIPAA comprobó que menos del 1 % de los registros podía reidentificarse cuando solo quedaban el año de nacimiento, el sexo y los 3 primeros dígitos del código postal: poco, pero no cero. (Fuente: NISTIR 8053.) Junto con la cifra del 87 % de Sweeney, la conclusión es clara: quitar los nombres es la parte fácil; el verdadero trabajo consiste en detectar los identificadores indirectos que, de forma discreta, singularizan a las personas —que es exactamente lo que debe hacer una buena herramienta de supresión, y no limitarse a localizar nombres.
Cómo eliminar la PII de sus archivos, de forma local
Una vez que sabe qué buscar, la forma segura de eliminarla es mantener todo el proceso en su propio equipo. Occlira es una aplicación de escritorio para Windows y macOS que detecta y elimina 40+ tipos de PII —nombres, identificadores nacionales, correos electrónicos, identificadores financieros, datos de salud y más— en documentos, hojas de cálculo, correo electrónico, audio e imágenes, 100 % en el dispositivo, sin nube y sin cuenta. Como también detecta los identificadores indirectos, y no solo los nombres, cubre el riesgo de reidentificación descrito más arriba.
Su anonimización es reversible: sustituye cada identificador por un marcador neutro y conserva la tabla de correspondencias en su dispositivo, de modo que puede restaurar los datos originales. En términos del RGPD, eso es seudonimización: una sólida medida de reducción de riesgo, pero, como se ha visto, el resultado sigue siendo datos personales, de modo que conviene tratarlo como minimización de datos y no como una vía para eludir la normativa. Consulte cómo anonimizar antes de ChatGPT o cómo suprimir datos en Word, PDF y Excel para ver el paso a paso.
Preguntas frecuentes
La PII (información de identificación personal) es cualquier información que puede identificar a una persona concreta, por sí sola o combinada con otros datos. El NIST la define en dos partes: la información que distingue o permite rastrear una identidad (un nombre, el SSN, la fecha y el lugar de nacimiento, los datos biométricos), más cualquier otra información vinculada o vinculable a esa persona (datos médicos, financieros, laborales o educativos).
«PII» es el término habitual en EE. UU.; «datos personales» es el término del RGPD y es más amplio: abarca todo lo relativo a una persona identificable, directa o indirectamente, e incluye expresamente los identificadores en línea, como las direcciones IP y los identificadores de cookies. La mayor parte de la PII también constituye datos personales; el RGPD simplemente amplía el alcance.
La PHI (información sanitaria protegida) es el subconjunto de la HIPAA: información de salud vinculada a uno de los 18 identificadores concretos y en poder de una entidad obligada, como un hospital o un plan de salud. Toda la PHI es PII, pero mucha PII (un correo electrónico corporativo, por ejemplo) no es PHI.
Sí. Una dirección de correo electrónico apunta a una persona concreta, sobre todo si es una dirección corporativa basada en el nombre, así que se considera PII en EE. UU. y datos personales según el RGPD.
Según el RGPD, sí: el considerando 30 menciona las direcciones IP entre los identificadores en línea que hacen identificable a una persona, por lo que son datos personales. En EE. UU., las definiciones la consideraban tradicionalmente PII solo en combinación con otros datos, aunque cada vez más también la incluyen por sí sola.
Un identificador directo permite identificar a alguien por sí solo (un SSN, un número de pasaporte, un correo electrónico). Los identificadores indirectos o cuasiidentificadores no identifican a nadie de forma aislada, pero sí en combinación: la fecha de nacimiento, el código postal, el sexo o el puesto de trabajo. El NIST señala que una lista de puntuaciones de crédito no identifica a nadie, pero, si se le añaden la edad, el domicilio y el sexo, las personas pasan a ser identificables.
La seudonimización sustituye los identificadores por marcadores reversibles mientras la tabla de correspondencias se guarda por separado; según el art. 4.5 del RGPD, el resultado sigue siendo datos personales. La anonimización persigue hacer imposible la reidentificación; solo entonces (considerando 26) los datos quedan fuera del RGPD. Las directrices de seudonimización de 2025 del CEPD confirman que los datos seudonimizados permanecen dentro del ámbito de aplicación.
Sí. Como pueden reatribuirse a una persona mediante la información adicional guardada por separado, los datos seudonimizados siguen siendo datos personales según el RGPD. Reducen el riesgo y permiten la reversibilidad, pero no equivalen a la anonimización.
A menudo, sí. Un estudio de referencia de Latanya Sweeney estimó que en torno al 87 % de la población de EE. UU. es identificable de forma unívoca a partir del código postal, la fecha de nacimiento completa y el sexo; una réplica posterior rebajó la cifra al 63 % aproximadamente. Por eso eliminar únicamente los nombres no anonimiza un conjunto de datos: los cuasiidentificadores aún pueden singularizar a las personas.
Encuentre y elimine la PII localmente
Detecte y elimine los datos personales de sus archivos, en su propio ordenador. Gratis durante 14 días en Windows y macOS.
Más: usar la IA sin infringir el RGPD · eliminar datos personales del audio · cómo se tratan sus datos