Cómo anonimizar documentos antes de pegarlos en ChatGPT
La forma más segura de usar la IA con un archivo sensible es eliminar primero los datos personales, pasar la IA sobre una copia anonimizada y restaurar después los valores reales, todo en su propio ordenador. Occlira hace justamente esto con documentos, hojas de cálculo, correo y audio, de modo que nada privado sale nunca de su equipo.
Por qué pegar datos sin tratar es más arriesgado de lo que parece
Parece inofensivo: usted copia un párrafo de un contrato o de una nota clínica en un cuadro de chat para conseguir un borrador rápido. Pero ese texto se envía a los servidores del proveedor, y no siempre se queda ahí. Un análisis de seguridad de Cyberhaven concluyó que alrededor del 11 % de todo lo que los empleados pegan en ChatGPT son datos confidenciales de la empresa, y la proporción de material sensible que va a parar a las herramientas de IA no ha dejado de crecer a medida que aumenta su uso. (Fuente: Cyberhaven Labs.)
No es una hipótesis. En apenas tres semanas desde que autorizó ChatGPT, ingenieros de Samsung filtraron material confidencial en tres ocasiones distintas —código fuente de semiconductores, rutinas de detección de defectos y la transcripción de una reunión interna— al pegarlo para depurar errores y redactar notas. Poco después, la empresa prohibió la IA generativa en sus dispositivos. (Fuente: Forbes.)
Tres malentendidos habituales sobre ChatGPT y la privacidad
Las garantías en las que suele confiar la gente no se sostienen tanto como parece:
- «Ya borraré la conversación». Borrar es una petición, no una garantía. En mayo de 2025, un tribunal estadounidense ordenó a OpenAI conservar los registros de ChatGPT —incluidas las conversaciones que los usuarios ya habían eliminado— como prueba en el caso del New York Times. La orden se acotó más tarde, pero la lección sigue vigente: una vez que su texto está en el servidor de otra persona, ya no es usted quien decide cuándo desaparece. (Fuente: OpenAI.)
- «Es solo para mí, no se usará para entrenar nada». En las cuentas Free, Plus y Pro, el entrenamiento del modelo está activado de forma predeterminada: hay que desactivar «Mejorar el modelo para todos» en los Controles de datos. Y la mayor parte del uso de ChatGPT en el trabajo se hace precisamente a través de estas cuentas personales. (Fuente: Centro de ayuda de OpenAI.)
- «Firmamos un acuerdo empresarial, así que estamos cubiertos». Un plan de empresa o un acuerdo de tratamiento de datos reduce la exposición, pero los datos personales siguen saliendo de su control para acabar en la infraestructura de un tercero, sujeta a su seguridad, a sus subencargados y a órdenes como la anterior. Para quien está sujeto al secreto profesional, ese riesgo es muy distinto al de mantener los datos en su propio equipo.
Cada uno de estos puntos apunta a la misma solución: no enviar los datos personales de entrada, que es exactamente lo que hace el flujo de trabajo de Occlira —anonimizar → usar la IA → restaurar—, en su propio equipo. Encontrará más información en ¿almacena ChatGPT sus datos?
El flujo seguro: anonimizar → usar la IA → restaurar
- Abra su archivo en Occlira. Arrastre el documento, la hoja de cálculo, el correo o el archivo de audio que iba a enviar a una herramienta de IA. No se sube nada: la detección se ejecuta en su propio equipo, así que el archivo no sale de su ordenador ni siquiera para analizarlo.
- Revise lo que se va a eliminar. Occlira resalta todos los nombres, correos electrónicos, números de teléfono, identificadores, datos financieros y mucho más. En un rápido paso de revisión, usted decide qué conserva y qué suprime; además, puede seleccionar y marcar cualquier texto que el detector haya pasado por alto. El control sobre lo que se sustituye es enteramente suyo.
- Anonimice. Los valores reales se sustituyen por marcadores neutros y coherentes: <PERSON_1>, <IBAN_1>, <DATE_1>. Como cada persona conserva la misma etiqueta a lo largo de todo el texto, este se sigue leyendo con normalidad. La tabla de correspondencias entre cada marcador y su valor original se guarda en local, así que el proceso es reversible.
- Use la herramienta de IA. Pegue o suba la versión anonimizada en ChatGPT, Claude, Gemini o Copilot y trabaje con normalidad. El modelo razona sobre los marcadores igual de bien que sobre los nombres reales, de manera que usted obtiene una respuesta útil (un borrador, un resumen, un análisis) sin que los datos personales lleguen jamás al proveedor.
- Restaure los originales. Devuelva el resultado de la IA a Occlira y recupere los valores reales a partir de su tabla de correspondencias local, para que el documento final quede completo y exacto. La restauración se realiza íntegramente en su dispositivo.
Qué anonimizar antes de pegar: una lista de comprobación rápida
El objetivo es eliminar todo lo que identifique a una persona, ya sea de forma directa o por combinación. Repase esta lista, que se corresponde con las categorías que Occlira detecta automáticamente (40+ tipos en total):
- Nombres de personas: clientes, pacientes, empleados, partes contrarias, testigos
- Datos de contacto: direcciones de correo electrónico, números de teléfono, direcciones postales
- Documentos de identidad e identificadores nacionales: número de la Seguridad Social, NINO, pasaporte, número de identificación fiscal, Codice Fiscale, DNI, INSEE
- Identificadores financieros: IBAN, números de cuenta y de tarjeta, cifras salariales
- Datos de salud: diagnósticos, números de historia clínica, cualquier cosa que revele una patología
- Fechas que permiten identificar a una persona: fechas de nacimiento, de ingreso o de vista judicial
- Números de expediente, de asunto, de factura y de referencia que remitan a un caso real
- Cuasi-identificadores: un puesto de trabajo poco frecuente unido a una ciudad, o cualquier dato lo bastante singular como para reidentificar a alguien por sí solo
Qué elimina Occlira
Nombres, direcciones de correo electrónico, números de teléfono, direcciones postales, IBAN y números de tarjeta, identificadores nacionales (número de la Seguridad Social, NINO, número de IVA, pasaportes y más), fechas de nacimiento, direcciones IP y números de historia clínica, en Word, PDF, Excel, correo y texto sin formato, además de grabaciones de audio. La detección se ejecuta en local con un modelo de IA reforzado con reglas de patrones precisas, y es usted quien confirma cada elemento en el paso de revisión, de modo que nada se suprime —ni se pasa por alto— sin su consentimiento.
¿Basta con anonimizar para cumplir la normativa?
Resuelve la parte más difícil del problema. Cuando pega la versión anonimizada, ningún dato identificativo llega al proveedor, de modo que no hay datos personales que un tercero pueda almacenar, usar para entrenar ni verse obligado a entregar. Ese es el principio de minimización de datos que los organismos reguladores esperan que usted aplique antes de recurrir a cualquier herramienta externa. Usar la IA sin incumplir el RGPD profundiza en este patrón práctico.
Conviene ser honestos con dos matices. Primero, la tabla de correspondencias que le permite restaurar los originales es en sí misma un dato personal, pero permanece en su dispositivo, de modo que su tratamiento es mínimo y queda bajo su control, en lugar de repartirse por la nube de un proveedor. Segundo, los organismos reguladores de la UE fijan un listón muy alto para considerar algo verdaderamente «anónimo»: el Dictamen 28/2024 del CEPD insiste en una evaluación caso por caso. Eliminar los datos identificativos antes de compartirlos es una medida sólida, no un sustituto de todas las obligaciones de su organización.
Reversible por diseño: seudonimización, no una caja negra
Como Occlira conserva una tabla de correspondencias local, su anonimización es reversible: en términos del RGPD,
eso es seudonimización. Y aquí está la ventaja práctica: los marcadores son coherentes (cada persona es
<PERSON_1> en todo el texto), de modo que la respuesta de la IA sigue encajando con sus datos reales cuando los restaura.
Obtiene la utilidad de trabajar sobre el documento real sin que este llegue nunca a quedar expuesto.
¿Funciona con Claude, Gemini y Copilot?
Sí. El enfoque no depende de la herramienta. Occlira genera una copia anonimizada que puede usar con cualquier asistente de IA; como los marcadores son coherentes, la respuesta sigue siendo igual de útil, y usted restaura los valores reales en su propio equipo cuando termina.
Preguntas frecuentes
Conviene partir de una idea: todo lo que pega en una herramienta de IA en la nube deja de estar bajo su control. En las cuentas personales, sus conversaciones pueden servir para entrenar el modelo a menos que desactive esa opción, y una orden judicial estadounidense de 2025 demostró que incluso las conversaciones eliminadas pueden conservarse. Lo prudente es eliminar primero los datos personales, trabajar con la IA sobre la versión con marcadores y restaurar después los valores reales en su propio equipo.
No. Los modelos trabajan sin problemas con marcadores coherentes como <PERSON_1> o <IBAN_1>: cada entidad conserva la misma etiqueta, de modo que el texto no pierde coherencia. Usted obtiene un borrador, un resumen o un análisis útiles y luego restaura los valores reales en local para que el documento final quede completo.
No a partir de los marcadores por sí solos: una etiqueta como <PERSON_1> no contiene ningún dato personal, y la tabla de correspondencias con el nombre real nunca sale de su ordenador. Basta con no dejar un contexto claramente identificativo —por ejemplo, una combinación única de puesto de trabajo y ubicación— que un lector pudiera resolver sin dicha tabla.
En las cuentas Free, Plus y Pro, el entrenamiento del modelo está activado de forma predeterminada: para impedirlo, tiene que desactivar «Mejorar el modelo para todos» en los Controles de datos. Ni el Chat temporal ni los productos empresariales (Team, Enterprise, la API) se emplean para el entrenamiento. Pero la protección más clara es, sencillamente, no enviar los datos personales en ningún caso.
No necesariamente. En mayo de 2025, un tribunal estadounidense ordenó a OpenAI conservar los registros de ChatGPT —incluidas las conversaciones que los usuarios habían eliminado— como prueba en el caso del New York Times. El alcance se acotó más tarde, pero sirve de recordatorio muy concreto: una vez que su texto está en los servidores de otra empresa, «eliminar» es una petición, no una garantía.
Resuelve la parte más difícil del problema: si no se envían nombres, identificadores ni otros datos identificativos, no hay datos personales que un tercero pueda almacenar, usar para entrenar o verse obligado a divulgar. Ese es, precisamente, el principio de minimización de datos que esperan los organismos reguladores. La tabla de correspondencias constituye en sí misma un dato personal, pero permanece en su dispositivo, con lo que usted reduce el tratamiento al mínimo y lo mantiene bajo su control. Es una medida sólida, no un sustituto de todas las obligaciones de cumplimiento de su organización.
Sí. El flujo de trabajo no depende de la herramienta: Occlira genera un archivo anonimizado que puede usar con cualquier asistente de IA y, después, restaura los originales en local.
Mismo principio, y aquí importa todavía más: además del texto visible, los archivos arrastran metadatos ocultos, control de cambios y comentarios. Occlira anonimiza el documento en su conjunto —incluidos esos datos ocultos—, de modo que la copia que usted sube queda limpia, no solo la parte que ve.
A ningún sitio. La detección, la anonimización, la tabla de correspondencias de los marcadores y la restauración se ejecutan íntegramente en su ordenador. Ni sus archivos ni los datos personales que contienen llegan nunca hasta nosotros ni a ningún servicio en la nube.
Mantenga privados sus archivos sensibles al usar la IA
Anonimice una vez, use la herramienta de IA que prefiera y restaure en local. Gratis durante 14 días en Windows y macOS.
Más: suprimir datos personales del audio · supresión de PII local frente a en la nube · para bufetes de abogados · cómo se tratan sus datos