Представим самый обычный рабочий сценарий. Мне присылают договор на двадцать страниц, а нейросеть предлагает за минуту найти штрафы, сроки, спорные формулировки и составить краткое резюме. Технически задача решается перетаскиванием PDF в окно чата. Но перед загрузкой я бы смотрела не на кнопку «Прикрепить файл», а на сам документ. Имею ли я право передать его внешнему сервису?
Мой короткий ответ простой. Публичные документы и собственные материалы без закрытой информации обычно можно отправлять в ИИ. Внутренние договоры, клиентские базы, кадровые файлы, медицинские документы, закрытый исходный код и материалы под NDA нельзя автоматически считать допустимыми только потому, что сервис платный, шифрует данные или обещает не обучать на них модель. Для рабочей информации имеют значение сразу несколько вещей, право на передачу, конкретный тип аккаунта, срок хранения, настройки обучения, подключенные приложения и правила работодателя.
| Документ | Что я бы делала |
|---|---|
| Публичная инструкция, опубликованный отчет, пресс-релиз | Можно загружать, если нет отдельных ограничений по авторским правам или условиям использования. |
| Собственный черновик без данных клиентов и компании | Обычно можно. Для личного аккаунта я все равно проверила бы настройки использования данных. |
| Внутренняя презентация | Лучше использовать одобренный компанией сервис и убрать сведения, которые модели не нужны. |
| Договор с ФИО, телефонами, подписями и реквизитами | Не отправлять целиком в личный аккаунт. Нужна разрешенная корпоративная схема либо действительно обезличенный фрагмент. |
| Клиентская или кадровая база | Не загружать в публичный пользовательский сервис без согласованной схемы обработки персональных данных. |
| Закрытый исходный код | Только в разрешенной компанией среде. Секреты нужно удалить в любом случае. |
Пароли, токены, закрытые ключи, секреты из .env |
Не отправлять. Для примера использовать фиктивные значения. |
| Коммерческая тайна или документ под NDA | Проверить договор, внутреннюю политику и условия конкретного поставщика ИИ до загрузки. |
Файл не «впитывается» в модель, но и не исчезает
Вокруг загрузки документов возник не очень полезный миф. Будто PDF сразу попадает внутрь нейросети, модель его запоминает, а завтра другой пользователь сможет попросить показать мой договор. Современная языковая модель не работает как общедоступный архив загруженных файлов. Даже если сервис использует пользовательские данные для улучшения моделей, из этого не следует, что документ мгновенно превращается в дословно извлекаемую часть новой модели.
Но противоположная крайность тоже неверна. После отправки файл не обязан исчезнуть сразу после ответа. Сервис принимает содержимое, извлекает нужные данные и передает их модели в контекст текущей задачи. Для больших документов платформа может дополнительно разбивать содержимое на части, индексировать его и хранить служебные представления, чтобы находить нужные фрагменты. Конкретная архитектура зависит от продукта.
Поэтому я разделяю четыре разных процесса. Первый связан с непосредственной обработкой документа ради ответа. Второй определяет, сколько хранится файл и связанный с ним разговор. Третий отвечает за возможное использование данных для улучшения или обучения моделей. Четвертый появляется, когда к нейросети подключены облачный диск, почта, корпоративная база или другой внешний сервис.
У ChatGPT различия особенно хорошо видны. В личном рабочем пространстве использование новых разговоров для улучшения моделей можно отключить. В ChatGPT Business, Enterprise, Edu и других корпоративных продуктах входные и выходные данные по умолчанию не используются для обучения моделей. Но «не используется для обучения» вовсе не означает «не хранится».
Более того, механизм хранения ChatGPT изменился так, что загруженные документы могут сохраняться отдельно от самого разговора. Файлы, попавшие в Library, остаются там до удаления пользователем или до срока, установленного политикой рабочего пространства. Удаление чата не обязательно удаляет сохраненный файл. После удаления файл обычно ставится в очередь на окончательное удаление в течение 30 дней с исключениями для юридических требований и задач безопасности. Подробные правила хранения полезно проверить перед работой с чувствительными материалами.
Временный чат уменьшает след. ChatGPT автоматически удаляет такие разговоры из своих систем в течение 30 дней и не использует их для улучшения моделей. Но временный режим не превращает личный аккаунт в разрешенное корпоративное хранилище. Если работодатель запрещает передавать договор внешнему поставщику, кнопка временного чата договорного запрета не отменит.
У Claude для личных Free, Pro и Max действует отдельный выбор, разрешать ли использование разговоров и сеансов программирования для улучшения Claude. Здесь есть неприятная деталь, которую легко пропустить. Если пользователь согласился передавать такие данные для улучшения моделей, новые и продолженные разговоры могут храниться до пяти лет. Коммерческие Claude for Work и API по умолчанию не используют входные и выходные данные для обучения, но собственные сроки хранения там зависят от продукта и договора. Даже договор с нулевым хранением относится не ко всем функциям Claude автоматически.
В личном Gemini при включенном сохранении активности пользовательские разговоры могут применяться для улучшения сервисов, а часть материалов проходит проверку людьми. Стандартный срок автоматического удаления активности составляет 18 месяцев, пользователь может выбрать другой срок. Разговоры, попавшие к проверяющим, способны храниться отдельно до трех лет. Если отключить сохранение активности или использовать временный чат, новые разговоры хранятся до 72 часов и не идут на обучение моделей, если пользователь отдельно не отправил отзыв. При этом данные все равно могут обрабатываться для работы сервиса и защиты от злоупотреблений.
У корпоративного Gemini в Google Workspace другой режим. Чаты и загруженные файлы не используются для обучения генеративных моделей за пределами организации и не передаются на обычную человеческую проверку без разрешения клиента. Срок хранения при этом не обязательно короткий. Администратор Workspace может задавать его, для некоторых режимов диапазон доходит до нескольких лет или бессрочного хранения.
С GigaChat тоже нельзя делать вывод по одному названию сервиса. У разных способов доступа действуют разные соглашения. В условиях для физлиц соответствующего варианта GigaChat прямо запрещено загружать любые персональные данные третьих лиц, а также собственные биометрические данные и специальные категории персональных данных. Для корпоративного GigaChat API условия другие, сервис заявляет, что запросы и ответы по умолчанию не хранятся и не используются для дообучения модели.
Получается немного парадоксальная картина. Платный личный ChatGPT Plus или Claude Pro не становится корпоративным продуктом только после оплаты подписки. И наоборот, корпоративный сервис не означает, что внутри компании разговор никто не увидит. В управляемых рабочих пространствах администратор организации в зависимости от продукта и настроек может получать возможности для аудита, экспорта, хранения или удаления рабочих данных. С точки зрения компании такая управляемость скорее плюс, но сотруднику полезно о ней знать.
В России проблема начинается раньше обучения модели
Самый слабый совет по такой теме звучит примерно так. «Отключите обучение, и можете загружать документы». Галочка действительно снижает один риск, но юридический вопрос появляется раньше. Сначала нужно понять, имела ли компания право передавать конкретные сведения выбранному поставщику и разрешала ли сотруднику такую передачу.
Закон № 152-ФЗ определяет персональные данные широко. Фамилия сама по себе не является единственным признаком. К персональным данным может относиться любая информация, связанная с прямо или косвенно определяемым человеком. Телефон, электронная почта, должность, номер заказа, адрес, учетный номер и сочетание нескольких признаков способны позволить определить человека даже после удаления имени.
Компания может поручить обработку персональных данных другому лицу, но для такой схемы нужны подходящее правовое основание и правильно оформленные отношения. В договоре или ином основании должны быть определены цели и условия обработки, требования к конфиденциальности и защите данных. Сводить весь 152-ФЗ к фразе «надо получить согласие пользователя» тоже неправильно. Закон предусматривает несколько правовых оснований, а конкретная схема зависит от того, зачем и кем обрабатываются данные.
Для зарубежной нейросети может дополнительно возникнуть трансграничная передача. Российский оператор перед ее началом должен учитывать требования статьи 12 закона № 152-ФЗ, включая отдельное уведомление Роскомнадзора и правила, зависящие от государства и иностранного получателя. После изменений законодательства требования к локализации при сборе персональных данных российских граждан стали жестче. Запись, систематизация, накопление, хранение, уточнение и извлечение таких данных при сборе с использованием зарубежных баз по общему правилу не допускаются, кроме прямо предусмотренных законом случаев.
Локализацию иногда трактуют слишком широко, будто российские персональные данные вообще никогда не могут обрабатываться за рубежом. Закон устроен сложнее. Требования к локализации при сборе и правила трансграничной передачи существуют одновременно, а конкретную архитектуру обработки компания должна оценивать целиком. Поэтому рядовому сотруднику точно не стоит самостоятельно строить юридическую схему путем загрузки базы клиентов в личный аккаунт зарубежной нейросети.
Медицинская информация требует еще большей осторожности. Сведения о состоянии здоровья входят в специальные категории персональных данных. Для их обработки закон устанавливает отдельные основания и ограничения. В организациях здравоохранения дополнительно может действовать режим врачебной тайны. История болезни или результаты обследования, присланные сотруднику для работы, совсем не равны собственному обезличенному вопросу о симптомах.
С коммерческой тайной другая тонкость. Файл не становится коммерческой тайной в юридическом смысле только потому, что менеджер написал сверху «Секретно». Закон № 98-ФЗ требует установить режим, определить перечень защищаемой информации, ограничить доступ, учитывать получивших его лиц, урегулировать отношения с работниками и контрагентами и маркировать документы установленным образом. Но отсутствие такого режима не дает сотруднику свободу публиковать внутренние сведения. Запрет может следовать из трудового договора, NDA, другого соглашения о конфиденциальности, законодательства о персональных данных или прав на интеллектуальную собственность.
NDA я бы вообще читала буквально. В одном соглашении разрешена передача информации согласованным подрядчикам, в другом требуется предварительное письменное согласие, в третьем поставщик должен соответствовать конкретным требованиям безопасности. Фраза поставщика ИИ «мы не обучаем модель на ваших данных» не добавляет его автоматически в список разрешенных получателей.
Материал предназначен для легальной и ответственной работы с данными. При обработке рабочих документов нужно соблюдать законодательство своей страны, особенно требования России к персональным данным и охраняемой информации, а также внутренние правила работодателя. Обезличивание нельзя использовать как способ обхода DLP, корпоративных запретов или правил доступа.
Почему удалить фамилию недостаточно
На практике меня больше всего настораживает бытовое «я все обезличил». Человек стирает имя клиента в первой строке договора и отправляет остальные двадцать страниц. Внутри остаются номер договора, телефон, должность, адрес, название компании, сумма сделки, подпись, номер счета и даты. Иногда нескольких признаков вполне хватает, чтобы понять, о ком идет речь.
Юридическое обезличивание тоже требует большего, чем простая замена Иванова на «Клиент № 1». Действующие требования Роскомнадзора предполагают, что определить принадлежность данных конкретному человеку без дополнительной информации должно быть невозможно. Среди методов есть замена идентификаторов, изменение состава и значений данных, перемешивание и другие способы. Обычная псевдонимизация может сохранить возможность восстановить личность и потому не всегда решает задачу.
У PDF есть отдельная ловушка. Черный прямоугольник поверх фамилии не гарантирует удаления текста из файла. Если редактор просто нарисовал фигуру поверх слоя с текстом, исходную строку иногда можно скопировать, извлечь программой или обнаружить после удаления графического объекта. Для чувствительных документов нужна функция необратимого удаления фрагмента, после чего стоит повторно открыть файл, попробовать выделить скрытый участок и проверить извлеченный текст.
Я бы также очищала комментарии, историю правок, встроенные вложения и метаданные. В офисном документе фамилия автора или внутреннее название проекта иногда остается именно там, хотя на видимой странице ничего подозрительного уже нет.
Для программного кода работает тот же принцип минимизации. Закрытый репозиторий может выдавать архитектуру продукта, внутренние домены, имена клиентов и устройство инфраструктуры. Еще опаснее действующие секреты. Токен API, пароль базы, закрытый SSH-ключ или строка подключения не становятся безопаснее оттого, что переданы через корпоративный чат. В примере достаточно API_KEY=<TEST_KEY>, настоящий ключ модели обычно не нужен.
У современных ИИ-агентов появился еще один класс риска. Загруженный документ может содержать не только данные для анализа, но и инструкции, способные изменить поведение модели. Если агент имеет доступ к почте, облачному диску или внешним инструментам, вредоносный текст внутри документа может попытаться заставить его обратиться к другим данным или выполнить нежелательное действие. Мы уже разбирали, как скрытые инструкции в документах и веб-страницах превращаются в проблему для ИИ-агентов. Чем больше прав получил агент, тем выше цена такой ошибки.
Есть и еще один слой, который легко забыть. Подключив к нейросети стороннее приложение, пользователь добавляет нового участника обработки. Корпоративные гарантии самого ChatGPT или Gemini не обязательно распространяются на любой подключенный внешний сервис. Перед работой с чувствительными файлами я бы проверяла не только модель, но и список подключений, их разрешения и правила передачи данных.
Как я решаю, загружать документ или нет
Я не пытаюсь определить, «безопасен ли ChatGPT вообще». Такой вопрос почти бессмыслен. Вместо него проверяю конкретную цепочку. Какой документ передаю, кому принадлежит информация, какой аккаунт открыт, что разрешает работодатель, сколько сервис хранит файл, идет ли содержимое на обучение, какие приложения подключены и кто внутри организации может получить доступ.
Если модели нужна одна формулировка из договора, я не отправляю договор целиком. Копирую необходимый абзац, заменяю реальные идентификаторы, убираю суммы и факты, которые не влияют на ответ. Такой принцип минимально необходимого объема данных полезнее десятка обещаний о конфиденциальности.
Для компаний правильная стратегия тоже не сводится к приказу «нейросети запрещены». Жесткий запрет часто просто порождает теневой ИИ, когда сотрудники продолжают пользоваться личными аккаунтами без контроля. Практичнее дать разрешенную корпоративную среду, разделить данные по категориям, определить сроки хранения, включить единый вход и административный контроль, ограничить ненужные приложения и настроить средства предотвращения утечек. Для особенно чувствительных задач можно рассматривать модель внутри собственного контура, но локальное размещение тоже не отменяет разграничение доступа, журналы, резервные копии и защиту самой инфраструктуры.
Главная граница проходит не между «хорошей» и «плохой» нейросетью. Граница проходит между контролируемой обработкой и случайной отправкой рабочего файла во внешний сервис. Корпоративный тариф заметно меняет условия, но не дает универсального разрешения на любые данные. Отключение обучения полезно, но не отменяет хранение, договоры, персональные данные и NDA. Обезличивание помогает только тогда, когда человек действительно перестает определяться по оставшейся информации.
Поэтому при сомнении я не загружаю исходный документ целиком. Беру минимальный фрагмент, удаляю лишние сведения или использую одобренную компанией систему. А если речь идет о клиентской базе, медицинских данных, коммерческой тайне, закрытых ключах или материале с жестким NDA, сначала должен появиться разрешенный процесс, и только потом кнопка загрузки.
Можно ли загружать рабочие документы в ChatGPT?
Можно, если компания разрешила конкретный сервис и соответствующую категорию данных. Для публичных и несекретных материалов риск невелик. Документы с персональными данными, коммерческой тайной, закрытым кодом или условиями NDA требуют согласованной корпоративной схемы.
Хранит ли ChatGPT загруженные PDF?
Может хранить. В актуальной версии ChatGPT загруженные файлы могут сохраняться в Library отдельно от истории разговоров. Удаление чата поэтому не всегда удаляет сохраненный файл, его нужно проверить и при необходимости удалить отдельно.
Использует ли ChatGPT рабочие документы для обучения?
Правила зависят от типа аккаунта и настроек. В личном рабочем пространстве использование новых разговоров для улучшения моделей можно отключить. В корпоративных ChatGPT Business и Enterprise входные и выходные данные по умолчанию не используются для обучения моделей.
Можно ли отправить договор в нейросеть?
Публичный шаблон или действительно обезличенный фрагмент обычно безопаснее полного договора. Реальный договор может содержать персональные данные, конфиденциальные условия, коммерческую тайну и информацию третьих лиц, поэтому для него лучше использовать только разрешенную работодателем среду.
Достаточно ли удалить имя перед загрузкой документа?
Нет. Человека могут определить по телефону, адресу, должности, номеру договора и сочетанию других признаков. В PDF и офисных документах дополнительно могут сохраняться комментарии, метаданные, история правок и скрытый текст.
Можно ли загружать исходный код компании в ChatGPT или Claude?
Только если компания разрешила конкретный сервис или корпоративный инструмент программирования. Из кода в любом случае нужно удалять действующие пароли, токены, закрытые ключи, строки подключения и другие секреты.
Корпоративный тариф полностью решает проблему конфиденциальности?
Нет. Корпоративные продукты обычно дают более строгие гарантии по обучению, хранению и административному контролю, но допустимость конкретного документа по-прежнему зависит от договора, внутренних правил, законодательства, настроек рабочего пространства и подключенных сервисов.