Диалог с Copilot может закончиться не только на серверах Microsoft. Внешние рецензенты получают реальные запросы пользователей, загруженные фотографии и результаты работы ИИ, а затем вручную решают, насколько хорошо система выполнила задачу.
В заданиях по редактированию изображений человеку показывают исходный запрос, оригинальную картинку и два варианта, созданных Copilot. Рецензент сравнивает точность правки, сохранность исходных деталей, визуальные артефакты и общее качество результата. Вопрос о границах такого доступа становится особенно заметным на фоне того, как GitHub Copilot уже расширил использование пользовательских данных для обучения ИИ.
Часть заданий содержит сексуализированные фотографии и запросы на откровенные правки реальных людей. Рецензенты также жаловались на изображения с потенциально незаконным или крайне неприятным содержимым. По данным расследования, как минимум часть такой работы проходит через платформу Prolific, которая предоставляет людей для обучения и оценки ИИ. Сама Prolific предупреждает исследователей, что при работе с генеративными моделями невозможно полностью контролировать контент, который увидят участники.
Один из рецензентов утверждает, что лица людей в поступавших ему заданиях оставались открытыми. Подрядчики при этом оценивают не только безопасность содержимого. От них требуют выбрать более удачный результат редактирования, ориентируясь в том числе на собственное визуальное впечатление. Такая практика добавляет новый контекст к уже существующим условиям Copilot, где Microsoft оставляет себе широкие возможности обработки пользовательского контента.
В официальной справке о приватности Microsoft прямо пишет, что часть разговоров Copilot проходит автоматическую и ручную проверку для улучшения продукта и цифровой безопасности. Загруженные файлы и изображения в обычном потребительском Copilot могут храниться до 18 месяцев, а разговоры, изображения и файлы могут использоваться для обучения моделей, если пользователь не отключил такую возможность. При подозрении на нарушение правил полностью отказаться от ограниченной ручной проверки нельзя.
Правила различаются для корпоративных аккаунтов. Microsoft заявляет, что разговоры пользователей с организационными Entra ID и данные Microsoft 365 не идут на обучение генеративных моделей по той же схеме. Полученные журналистами внутренние документы показывают именно практическую сторону человеческой оценки Copilot. В ответ компания заявила, что использует клиентские данные в соответствии со своими условиями, в том числе для улучшения продуктов и контроля соблюдения правил.
Microsoft оказалась не единственной компанией с подобной практикой. В сентябре выяснилось, что подрядчики OpenAI также читают реальные диалоги ChatGPT, включая разговоры с личной и чувствительной информацией, чтобы оценивать качество ответов модели.
Сам Copilot уже сталкивался и с техническими рисками для конфиденциальности. Летом цепочка уязвимостей SearchLeak позволяла через помощника извлекать корпоративные письма, файлы и коды подтверждения после перехода пользователя по специально подготовленной ссылке.
Отдельная проблема связана с изображениями. Недавняя проверка OpenAI показала, что даже загруженные в ИИ файлы могут неожиданно покинуть предполагаемый закрытый контур. В одном из экспериментов агенты фактически вынесли пользовательские изображения во внешний интернет, что ещё раз показывает риск передачи нейросетям материалов, которые человек считает приватными.
