Как обезличить документ перед вставкой в ChatGPT
Самый безопасный способ применить ИИ к конфиденциальному файлу — сначала убрать персональные данные, прогнать через нейросеть обезличенную копию, а реальные значения восстановить уже потом — и всё это на вашем компьютере. Именно это Occlira и делает с документами, таблицами, письмами и аудио, так что ничего личного ваше устройство не покидает.
Почему вставлять данные в открытом виде опаснее, чем кажется
На первый взгляд ничего страшного: вы копируете абзац из договора или медицинской карты в окно чата, чтобы быстро получить черновик. Вот только этот текст уходит на серверы поставщика — и на этом дело не всегда заканчивается. Исследование безопасности компании Cyberhaven показало, что около 11% всего, что сотрудники вставляют в ChatGPT, — это конфиденциальные корпоративные данные, и по мере распространения таких инструментов доля чувствительной информации, утекающей в ИИ-сервисы, стремительно растёт. (Источник: Cyberhaven Labs.)
И это не домыслы. Примерно за три недели после того, как в Samsung разрешили ChatGPT, инженеры компании трижды допустили утечку конфиденциальных материалов — исходного кода полупроводников, алгоритмов выявления дефектов и стенограммы внутреннего совещания, — вставляя их, чтобы отладить код и оформить заметки. Вскоре компания запретила генеративный ИИ на своих устройствах. (Источник: Forbes.)
Три заблуждения о ChatGPT и конфиденциальности
Доводы, на которые обычно полагаются, выдерживают проверку хуже, чем принято думать:
- «Да я же просто удалю переписку». Удаление — это просьба, а не гарантия. В мае 2025 года суд в США обязал OpenAI сохранить журналы ChatGPT — включая переписки, которые пользователи уже удалили, — в качестве доказательств по делу The New York Times. Позже рамки предписания сузили, но урок остаётся прежним: как только ваш текст оказывается на чужом сервере, уже не вам решать, когда он исчезнет. (Источник: OpenAI.)
- «Это же только для меня, ни на чём обучаться не будут». На аккаунтах Free, Plus и Pro обучение модели включено по умолчанию — чтобы его отключить, нужно снять параметр «Improve the model for everyone» в разделе Data Controls. А большинство рабочих задач в ChatGPT решают именно через такие личные аккаунты. (Источник: Справочный центр OpenAI.)
- «Мы подписали корпоративный договор, значит, мы защищены». Корпоративный тариф или соглашение об обработке данных снижает риски, но персональные данные всё равно выходят из-под вашего контроля и попадают в инфраструктуру третьей стороны — с её системой безопасности, её субподрядчиками и предписаниями вроде описанного выше. Для всех, кто связан профессиональной тайной, это уже совсем другой риск, чем хранение данных на собственном компьютере.
Каждый из этих пунктов ведёт к одному и тому же выводу: персональные данные лучше вообще не отправлять — а именно это и делает Occlira по своему сценарию «обезличить → обратиться к ИИ → восстановить», прямо на вашем компьютере. Подробнее — в статье хранит ли ChatGPT ваши данные?
Безопасный порядок работы: обезличить → обратиться к ИИ → восстановить
- Откройте файл в Occlira. Перетащите документ, таблицу, письмо или аудиозапись, которые собираетесь отправить в ИИ-сервис. Никуда ничего не загружается: распознавание идёт прямо на вашем компьютере, поэтому файл не покидает устройство даже ради того, чтобы его просканировать.
- Проверьте, что будет удалено. Occlira подсветит каждое имя, адрес электронной почты, номер телефона, документ, финансовую деталь и многое другое. На быстром этапе проверки вы по каждому пункту сами решаете — оставить или скрыть, — а любой пропущенный фрагмент можете выделить и отметить вручную. Что именно заменять, решаете только вы.
- Обезличьте. Реальные значения заменяются единообразными нейтральными псевдонимами — <PERSON_1>, <IBAN_1>, <DATE_1>. Один и тот же человек всюду получает одну и ту же метку, поэтому текст остаётся связным. Таблица соответствий между псевдонимами и исходными значениями хранится локально, так что замену всегда можно отменить.
- Обратитесь к ИИ. Вставьте или загрузите обезличенную версию в ChatGPT, Claude, Gemini или Copilot и работайте как обычно. Для модели псевдонимы — это те же имена, поэтому вы получаете рабочий результат — черновик, конспект, разбор, — а персональные данные при этом к поставщику не попадают.
- Восстановите оригиналы. Загрузите ответ нейросети обратно в Occlira и подставьте реальные значения из локальной таблицы соответствий — итоговый документ будет полным и точным. Восстановление идёт целиком на вашем устройстве.
Что обезличить перед вставкой — краткий чек-лист
Задача — убрать всё, что позволяет опознать человека: напрямую или в сочетании с другими деталями. Пройдитесь по этому списку — он соответствует категориям, которые Occlira распознаёт автоматически (всего 40+ типов):
- Имена людей — клиентов, пациентов, сотрудников, оппонентов, свидетелей
- Контактные данные — адреса электронной почты, номера телефонов, почтовые адреса
- Государственные и национальные идентификаторы — SSN, NINO, паспорт, ИНН, Codice Fiscale, DNI, INSEE
- Финансовые идентификаторы — номера IBAN, счетов и карт, размер зарплаты
- Медицинские сведения — диагнозы, номера медицинских карт, всё, что раскрывает состояние здоровья
- Даты, указывающие на конкретного человека, — даты рождения, госпитализации, судебного заседания
- Номера дел, производств, счетов и любые ссылки, ведущие к реальному файлу
- Квазиидентификаторы — редкая должность вкупе с названием города или любая деталь, настолько уникальная, что сама по себе выдаёт человека
Что удаляет Occlira
Имена, адреса электронной почты, номера телефонов, почтовые адреса, номера IBAN и банковских карт, национальные идентификаторы (SSN, NINO, VAT, паспорта и прочие), даты рождения, IP-адреса и номера медицинских карт — в форматах Word, PDF, Excel, в письмах и обычном тексте, а также в аудиозаписях. Распознавание идёт локально с помощью ИИ-модели, подкреплённой точными правилами на основе шаблонов, а каждый пункт вы подтверждаете на этапе проверки — так что без вашего ведома ничего не скрывается и ничего не упускается.
Достаточно ли обезличивания, чтобы соблюсти требования?
Оно снимает самую сложную часть задачи. Когда вы вставляете обезличенную версию, к поставщику не попадает ни один идентификатор — а значит, у третьей стороны попросту нет персональных данных, которые можно было бы хранить, пускать на обучение или потребовать передать. Это и есть принцип минимизации данных, соблюдения которого регуляторы ждут от вас перед использованием любого внешнего инструмента. Практическая схема разобрана в статье как использовать ИИ, не нарушая GDPR.
Две честные оговорки. Во-первых, таблица соответствий, по которой восстанавливаются оригиналы, сама по себе является персональными данными — но она остаётся на вашем устройстве, так что ваша обработка минимальна и под вашим контролем, а не разбросана по облаку поставщика. Во-вторых, планка, при которой в ЕС что-либо считается по-настоящему «анонимным», очень высока: в Заключении 28/2024 EDPB подчёркивает, что оценивать нужно каждый случай в отдельности. Удаление идентификаторов перед передачей — это одна весомая мера, а не замена всех обязанностей вашей организации.
Обратимость по замыслу: псевдонимизация, а не «чёрный ящик»
Поскольку Occlira хранит локальную таблицу соответствий, его обезличивание обратимо — в терминах GDPR это
псевдонимизация. Практический смысл вот в чём: псевдонимы единообразны (один и тот же человек всюду обозначен как
<PERSON_1>), поэтому при восстановлении ответ ИИ по-прежнему ложится на ваши реальные данные. Вы получаете всю
пользу от работы с настоящим документом, а сам документ при этом ни разу не оказывается открытым.
Работает ли это с Claude, Gemini и Copilot?
Да. Подход не зависит от инструмента. Occlira создаёт обезличенную копию, пригодную для любого ИИ-помощника; благодаря единообразным псевдонимам вы по-прежнему получаете полезный ответ, а по завершении восстанавливаете реальные значения у себя на компьютере.
Частые вопросы
Исходите из того, что всё вставленное в облачный ИИ-сервис выходит из-под вашего контроля. На личных аккаунтах переписки могут идти на обучение модели, если вы это не отключили, а в 2025 году судебное решение в США показало, что сохраняться могут даже удалённые переписки. Безопаснее поступить иначе: сначала убрать персональные данные, поработать с ИИ над версией с псевдонимами, а затем восстановить реальные значения на своём компьютере.
Нет. Модели прекрасно справляются с единообразными псевдонимами вроде <PERSON_1> или <IBAN_1>: одна и та же сущность всюду сохраняет одну и ту же метку, поэтому текст остаётся связным. Вы получаете рабочий черновик, конспект или разбор, а затем локально возвращаете реальные значения, чтобы итоговый документ был полным.
По одним лишь псевдонимам — нет: метка вроде <PERSON_1> не несёт никакой личной информации, а таблица соответствий с реальными именами не покидает ваш компьютер. Достаточно лишь не оставлять явно опознавательный контекст (например, уникальное сочетание должности и места), который читатель мог бы разгадать и без таблицы соответствий.
На аккаунтах Free, Plus и Pro обучение модели включено по умолчанию — чтобы его прекратить, отключите параметр «Improve the model for everyone» в разделе Data Controls. Временные чаты и корпоративные продукты (Team, Enterprise, API) для обучения не используются. Но самая надёжная защита — вообще не отправлять персональные данные.
Не обязательно. В мае 2025 года суд в США обязал OpenAI сохранять журналы ChatGPT — включая переписки, которые пользователи уже удалили, — в качестве доказательств по делу The New York Times. Позже рамки предписания сузили, но урок нагляден: как только ваш текст оказывается на серверах другой компании, «удалить» — это просьба, а не гарантия.
Оно снимает самую сложную часть задачи: если не отправлены ни имена, ни идентификаторы, ни другие данные, то у стороннего сервиса попросту нет персональных данных, которые можно было бы хранить, пускать на обучение или потребовать раскрыть, — а это ровно тот принцип минимизации данных, которого ждут регуляторы. Локальная таблица соответствий сама по себе является персональными данными, но она остаётся на вашем устройстве, поэтому обработка сведена к минимуму и находится под вашим контролем. Это одна весомая мера, а не замена всех обязанностей вашей организации по соблюдению требований.
Да. Порядок работы не зависит от инструмента: Occlira создаёт обезличенный файл, пригодный для любого ИИ-помощника, а исходные значения вы восстанавливаете локально.
Принцип тот же, и здесь он даже важнее: помимо видимого текста файлы несут в себе скрытые метаданные, исправления и комментарии. Occlira обезличивает сам документ — вместе с этими скрытыми данными, — поэтому загружаемая копия очищена целиком, а не только на видимую её часть.
Никуда. Распознавание, обезличивание, таблица соответствий псевдонимов и восстановление — всё это происходит на вашем компьютере. Ни ваши файлы, ни персональные данные из них не попадают ни к нам, ни в какой бы то ни было облачный сервис.
Сохраняйте конфиденциальность файлов при работе с ИИ
Обезличьте один раз, работайте с любым ИИ, восстанавливайте локально. Бесплатно 14 дней на Windows и macOS.
Ещё: удаление персональных данных из аудио · локальная или облачная обработка персональных данных · для юридических фирм · как мы обращаемся с вашими данными