Я бы не отправляла нейросети документ, фотографию или кусок закрытого кода только потому, что рядом нашлась кнопка «не использовать мои данные для обучения». У ChatGPT, Gemini, Grok, GitHub Copilot и LinkedIn такие настройки действительно есть, но работают по-разному. Meta дает формальное право возражать против обучения на публичных публикациях прежде всего в отдельных юрисдикциях, Reddit вообще не предлагает универсальный переключатель для публичных постов, а Adobe заявляет, что обычные файлы Creative Cloud для обучения собственных моделей Firefly не использует.
Главная проблема скрыта в слове обучение. Выключив обучение модели, пользователь обычно не запрещает сервису хранить разговор ради безопасности, анализировать запрос для борьбы со злоупотреблениями, персонализировать ответы или обрабатывать данные после отправки отзыва. Еще сложнее обстоят дела с прошлым. Почти ни один сервис не обещает удалить влияние конкретной фотографии или переписки из модели, которую уже обучили.
Для сравнения я проверила действующие справки и политики самих компаний и сверила спорные места с независимыми публикациями. Удобную общую картину по части сервисов также дает разбор The Verge, но старые пошаговые инструкции я бы воспринимала осторожно. Компании меняют меню, названия настроек и правила обработки данных быстрее, чем успевают обновляться руководства.
Материал посвящен управлению собственными данными и настройками приватности. Соблюдайте законодательство своей страны, включая требования российского права, а также правила используемых сервисов. Настройки и технические ограничения нельзя применять для несанкционированного доступа, слежки, взлома или других незаконных действий.
Что именно происходит с вашими данными
Разговор с чат-ботом может пройти сразу через несколько разных механизмов. Сервис получает запрос, сохраняет его в истории, проверяет автоматическими системами безопасности, иногда передает обезличенную или отделенную от аккаунта копию специалистам, использует историю для персонализации и только затем может добавить материал в процесс улучшения или обучения моделей.
Поэтому четыре похожих действия дают совершенно разный результат.
- Отключение обучения обычно запрещает использовать будущие запросы или другой контент для изменения моделей.
- Удаление истории убирает разговор из пользовательского аккаунта, но не всегда уничтожает копии, ранее отделенные от аккаунта для проверки качества или безопасности.
- Отключение памяти мешает чат-боту использовать прежние сведения для персонализации будущих ответов, но само по себе не равнозначно отказу от обучения.
- Удаление публикации убирает исходный материал с платформы, но не гарантирует исчезновение копий, которые уже законно получили партнеры или которые успели войти в набор данных.
Есть еще техническая причина, почему обещание «удалить мой текст из модели» встречается редко. Нейросеть не работает как архив, где каждому абзацу соответствует отдельная строка базы данных. Во время обучения алгоритм меняет огромное количество параметров на основании огромного массива примеров. Модели способны запоминать отдельные фрагменты тренировочных данных, поэтому говорить, что исходных сведений внутри модели «вообще нет», тоже неправильно. Но удалить влияние одного конкретного примера значительно сложнее, чем стереть запись из истории аккаунта.
Где можно запретить обучение ИИ
| Сервис | Что может использоваться | Как ограничить | Главное ограничение |
|---|---|---|---|
| Facebook и Instagram | Meta использует для генеративного ИИ публичный контент взрослых пользователей, включая публикации, комментарии, фотографии и подписи, а также взаимодействия человека с Meta AI. Личные сообщения между людьми компания не относит к такому тренировочному массиву, если пользователь сам не передает содержимое функции Meta AI. | Для пользователей ЕС Meta предоставляет форму возражения против использования публичной информации для обучения. Компания также внедряла аналогичный механизм в Великобритании. Если возражение уже было принято, Meta заявляет, что повторно подавать его не требуется. | Универсального переключателя, который Meta документирует как одинаково доступный каждому пользователю во всех странах, нет. Поэтому российскому аккаунту нельзя автоматически приписывать те же права и интерфейс, которые компания гарантирует пользователю из ЕС. |
| X и Grok | X может использовать публичные данные аккаунта, а также взаимодействия с Grok, запросы и результаты для создания и доработки моделей xAI. | Откройте Settings and privacy, затем Privacy and safety, Data sharing and personalization, Grok & Third-party Collaborators и отключите Data Sharing. Закрытие аккаунта X также мешает использовать публикации как публичный тренировочный материал. | После отказа Grok продолжает работать. Однако добровольная оценка ответа, например кнопкой с пальцем вверх или вниз, снова может передать соответствующий разговор для улучшения модели. X отдельно предупреждает, что отказ не запрещает уже работающим функциям на базе Grok адаптироваться в ходе обычного использования. |
| Google Gemini | При включенной Keep Activity Google может использовать сохраненные разговоры и переданный контент, включая файлы, фотографии, видео и экран, для развития сервисов и обучения генеративных моделей. Для аудио и видео Gemini Live действуют дополнительные настройки, и по умолчанию Google не использует такие записи для улучшения сервисов. | Выключите Keep Activity в Gemini Apps Activity или используйте временный чат. Если Keep Activity выключена и пользователь не отправляет отзыв, будущие разговоры не используются для обучения моделей. | Google все равно хранит такие разговоры с аккаунтом до 72 часов для работы сервиса и защиты систем. Материалы, которые ранее попали к специалистам для проверки, могут храниться отдельно до трех лет и не исчезают после обычного удаления Gemini Activity. |
| GitHub Copilot | GitHub может использовать запросы, ответы, фрагменты кода и связанный контекст пользователей индивидуальных тарифов Copilot Free, Pro и Pro+ для обучения и улучшения моделей, если пользователь не отказался. | В настройках GitHub Copilot найдите параметр Allow GitHub to use my data for AI model training и отключите его. | Copilot Business и Enterprise под эту схему не попадают. GitHub заявляет, что данные таких клиентов не использует для обучения моделей по умолчанию. Для разработчика разница принципиальна, потому что закрытый корпоративный репозиторий и личная подписка Copilot регулируются разными условиями. |
| LinkedIn перечисляет среди потенциальных тренировочных данных профиль и фотографию, публикации, статьи, комментарии, ответы в опросах, некоторые сведения из сохраненных резюме, запросы к генеративным функциям и отзывы. | В Data Privacy можно отключить Data for Generative AI Improvement. | Отказ действует на будущее и не отменяет уже проведенное обучение. Настройка касается моделей, создающих контент, но не всех алгоритмов персонализации, безопасности и борьбы со злоупотреблениями. Отправленный пользователем отзыв также может использоваться отдельно даже после отключения основного переключателя. | |
| ChatGPT | В личных версиях ChatGPT разговоры и переданный пользователем контент могут использоваться для улучшения моделей в зависимости от настроек аккаунта. | Откройте Settings, Data Controls и выключите Improve the model for everyone. Новые разговоры останутся в обычной истории, но не будут использоваться для обучения. Для чувствительной разовой беседы можно открыть Temporary Chat. | Временный чат не используется для обучения и не появляется в истории, но OpenAI может хранить копию до 30 дней ради безопасности. Есть знакомая уже по другим сервисам ловушка. Если пользователь вручную отправляет отзыв на ответ, связанный с отзывом разговор может использоваться для обучения даже после общего отказа. |
| Microsoft Copilot | Здесь я бы вообще не доверяла старым инструкциям из поисковой выдачи. В прежней версии потребительского Copilot Microsoft позволяла отдельно отключать обучение на текстовых и голосовых разговорах. | После выпуска обновленного приложения Microsoft сама пометила прежние страницы с переключателями Training on conversation activity как относящиеся только к старой версии. Новая справка для персонального Copilot описывает память, историю, персонализацию и веб-поиск, но прежний универсальный путь к переключателю обучения там уже не документирован. | Инструкция вида «Privacy → Training on conversation activity → Off» больше не подходит всем пользователям. Сначала нужно определить версию Copilot и сверить доступные параметры в текущем интерфейсе. Корпоративный Microsoft 365 Copilot с рабочей или учебной учетной записью регулируется отдельно. |
| Действующее пользовательское соглашение Reddit прямо предусматривает возможность предоставлять пользовательский контент партнерам и использовать публичные материалы в контексте ИИ и машинного обучения. | Универсального аккаунтного переключателя «не использовать мои публичные сообщения для обучения ИИ» в действующих настройках Reddit нет. | Удалить публикацию можно, но удаление нельзя считать командой на откат уже состоявшегося обучения или отзыв копий у всех получивших материал партнеров. Показательно, что Reddit одновременно продает лицензированный доступ к публичному контенту разработчикам ИИ и судится с компаниями, которых обвиняет в получении материалов обходными способами. Для Reddit вопрос стоит не только в использовании публикаций, но и в том, кто и на каких условиях получает к ним доступ. | |
| Adobe | Популярное утверждение «Adobe берет мои PSD и фотографии из Creative Cloud и обучает на них Firefly» не соответствует заявленной политике компании. Adobe говорит, что обычный пользовательский контент Creative Cloud и Document Cloud не использовался и не используется для обучения собственных генеративных моделей Firefly. | Специально отключать обучение Firefly на обычных облачных файлах не требуется. Отдельная настройка анализа контента относится к улучшению продуктов и негenerativeным алгоритмам, а не к тренировке Firefly. | Есть исключения другого типа. Adobe Stock существует на условиях отдельной лицензии, а пользователь может сознательно предоставить материалы для создания специализированной модели. Такие сценарии нельзя смешивать с обычным хранением файла в Creative Cloud. |
| Claude | Anthropic дает пользователям Claude Free, Pro и Max возможность выбирать, разрешать ли использовать разговоры и сеансы программирования для улучшения моделей. Для корпоративных продуктов и API действуют отдельные правила, где клиентские данные по умолчанию не предназначены для обучения моделей. | Проверьте настройку Help improve Claude в разделе приватности. Для отдельной чувствительной беседы можно использовать Incognito chat. | Инкогнито-чаты не попадают в историю и не используются для обучения, но Anthropic обычно хранит их 30 дней. Отзывы и разговоры, которые системы безопасности отметили для проверки, могут обрабатываться по отдельным правилам. |
Таблица показывает неприятную закономерность. Единого стандарта отказа нет. У X, Gemini, GitHub, LinkedIn, ChatGPT и Claude пользователь получает достаточно понятный контроль. Meta связывает часть прав с юрисдикцией. У Reddit отдельного отказа для публичных публикаций нет. Adobe вообще представляет противоположный случай, потому что обычные пользовательские файлы не входят в заявленный тренировочный набор Firefly. Microsoft сейчас находится в переходном состоянии, из-за чего старые инструкции для Copilot особенно легко вводят читателя в заблуждение.
Почему выключатель часто защищает меньше, чем кажется
Первая ловушка связана с отзывами. В нескольких сервисах кнопки оценки ответа образуют отдельный канал передачи данных. Человек отключает обучение, задает конфиденциальный вопрос, получает плохой ответ и нажимает «не нравится». Вместе с оценкой сервис может получить контекст разговора и использовать его для улучшения модели. Такая оговорка есть у Google, X, LinkedIn и OpenAI. Для чувствительного диалога я бы вообще не отправляла содержательный отзыв.
Вторая ловушка связана с публичностью. Настройка чат-бота не обязательно регулирует публикации в социальной сети. Пост, фотография или комментарий могут использоваться по отдельным правилам платформы, даже если пользователь запретил обучение на личных разговорах с ИИ. Особенно хорошо разница видна у Meta, X и Reddit.
Третья ловушка связана с прошлым. LinkedIn прямо предупреждает, что отказ не влияет на обучение, которое уже произошло. Google отдельно хранит некоторые проверенные специалистами данные после удаления пользовательской активности. Остальные крупные платформы тоже формулируют отказ главным образом как ограничение дальнейшего использования. Кнопка opt-out не равна процедуре «разобучить модель».
Четвертая ловушка связана с тарифом. Потребительский и корпоративный аккаунты одного сервиса могут иметь совершенно разные правила. GitHub Copilot Business и Enterprise, корпоративные продукты OpenAI, рабочий Microsoft 365 Copilot и коммерческие предложения Anthropic дают организациям более жесткие гарантии относительно тренировочного использования данных. Поэтому я бы не делала вывод о защите рабочего кода по настройкам собственного бесплатного аккаунта.
Отсюда простой вывод для рабочих секретов, медицинских сведений, паспортов, договоров, исходного кода и частных фотографий. Переключатель обучения полезен, но не превращает массовый чат-бот в защищенное хранилище. Если утечка конкретного файла создаст серьезную проблему, я бы не отправляла такой файл потребительскому сервису вообще либо использовала корпоративный продукт с подходящими договорными гарантиями и политикой хранения.
А можно просто запретить роботам обучаться на моем сайте
В России ситуация сложнее, чем кажется по обсуждениям нового закона об ИИ. Федеральный закон № 243-ФЗ уже подписан, но основная часть вступает в силу только 1 сентября. Положения статьи 10, связанные с использованием произведений при обучении суверенных и национальных больших фундаментальных моделей, должны вступить в силу еще позже, 1 марта 2027 года.
Принятая редакция статьи 10 предусматривает специальный режим для правомерно полученных произведений и для материалов, опубликованных в интернете без технических ограничений на компьютерный анализ. Но считать такую конструкцию окончательной я бы пока не стала. Уже после принятия закона появилась инициатива убрать соответствующее исключение из закона об ИИ и перенести регулирование в Гражданский кодекс. Предлагаемая схема дает правообладателю возможность публично запретить применение произведения для обучения, а при отсутствии запрета предусматривает использование с выплатой вознаграждения, если стороны не договорились об ином. Подробности предлагаемых поправок разбирал SecurityLab.
Поэтому совет «добавьте строку в robots.txt, и нейросетям станет юридически запрещено учиться на сайте» я считаю слишком смелым. Файл robots.txt исторически сообщает автоматическим роботам правила обхода сайта. Разработчик может добровольно учитывать такие сигналы, а будущие нормы могут придать техническому запрету дополнительное значение. Но единого всемирного механизма, который одним файлом запрещает OpenAI, Google, Meta, xAI, российской компании и неизвестному сборщику данных использовать произведение для обучения, не существует.
Для обычного пользователя я бы действовала проще. В ChatGPT, Grok, Gemini, GitHub Copilot, LinkedIn и Claude нужно проверить именно настройку обучения, а не только историю или память. Временные и инкогнито-чаты полезны для разовых разговоров, но не отменяют кратковременное техническое хранение. Отзывы на чувствительные ответы лучше не отправлять. Публичные фотографии, тексты и комментарии я бы изначально считала действительно публичными, если платформа прямо не дает более сильной гарантии.
Самое неприятное правило одновременно самое полезное. Если информация не должна однажды оказаться в тренировочном наборе, у специалиста по проверке качества, у подрядчика или в системе безопасности сервиса, надежнее всего не передавать ее потребительскому ИИ. Все остальные меры уменьшают риск, но не превращают внешнюю нейросеть в личный сейф.