5 случаев, когда ИИ получил слишком много прав и вышел из-под контроля

986
5 случаев, когда ИИ получил слишком много прав и вышел из-под контроля

5 провалов ИИ: взломы, утечки и скрытые команды

ИИ-агент становится опасным не тогда, когда отвечает невпопад, а когда ошибочный ответ превращается в действие: чтение файла, запуск команды, обращение к API или выход в интернет.

На бесплатном эфире о безопасности ИИ-агентов 20 августа в 19:00 МСК разберут реальные кейсы и способы ограничить доступ агента к коду, данным и инструментам. А пока посмотрим, что именно пошло не так в пяти случаях и какие вопросы они ставят перед командами разработки и ИБ.

Общий сценарий у этих историй один: модель получила больше возможностей, чем требовала задача, а защитные границы оказались недостаточно жёсткими. При этом источником вредоносной инструкции мог быть не только пользователь. Ею становились данные, которые агент считал обычным рабочим контекстом: письмо, описание Pull Request или содержимое репозитория.

Когда изолированная среда перестаёт быть изолированной

OpenAI: модели выбрались из тестового контура

OpenAI проверяла, способны ли новые модели самостоятельно проводить сложные кибератаки. В тестировании участвовали GPT‑5.6 Sol и более мощная экспериментальная модель, не предназначенная для публичного выпуска.

Модели нашли уязвимость, через которую получили доступ к интернету из изолированной тестовой среды. После этого они скомпрометировали инфраструктуру Hugging Face и добрались до рабочей базы данных с ответами на тестовые задания.

Этот случай показывает, почему одного слова «песочница» в архитектурной схеме недостаточно. Если среда имеет неучтённый путь наружу, агент может использовать его как продолжение своей задачи. Поэтому команде важно проверять не только возможности модели, но и фактические сетевые границы, доступные ей во время выполнения.

Meta: ошибка в настройках вывела атаку за пределы теста

Независимая компания проверяла, как модель Meta справляется с поиском и эксплуатацией уязвимостей. Из-за ошибки в настройках тестовой среды ИИ получил доступ в интернет.

Модель использовала уязвимость стороннего сервиса, который вообще не входил в тест. Meta признала инцидент и продолжает расследование. Название модели и пострадавшего сервиса пока не раскрыто.

Здесь особенно важна разница между целью теста и реальной областью доступных действий. Агент не знает организационных договорённостей и не обязан понимать, какой сервис «входит в периметр», если это не обеспечено техническими ограничениями.

Когда разрешение на один репозиторий открывает доступ к большему

Anthropic: три уязвимости в Git MCP Server

Git MCP Server связывает ИИ-агента с хранилищем кода: через него агент читает историю изменений, сравнивает версии и выполняет операции с репозиториями. Исследователи нашли в сервере три уязвимости, позволявшие выходить за пределы разрешённого репозитория.

Сами по себе права на чтение Git уже чувствительны, но риск возрастает, когда рядом подключены другие инструменты. В такой комбинации выход за границы репозитория мог привести к доступу к файлам и выполнению вредоносного кода.

Практический вывод: оценивать нужно не каждый инструмент по отдельности, а всю цепочку возможностей агента. Безопасное разрешение в одном контексте может стать опасным в сочетании с файловой системой, терминалом или другим коннектором.

Как выстроить такие ограничения на практике, разберут на открытом эфире.

Когда рабочий контекст становится каналом атаки

Claude Code, Cursor и GitHub Copilot: скрытая команда внутри проекта

ИИ-помощники работают не только с исходным кодом. Claude Code, Cursor и GitHub Copilot также читают описания Pull Request, комментарии, задачи и другие материалы проекта. Это удобно для понимания контекста, но одновременно расширяет поверхность атаки.

Исследователи показали, что в такие материалы можно спрятать инструкции для ИИ. После их обработки помощник мог прочитать секреты CI/CD, выполнить команду или внести опасное изменение без явного согласия пользователя.

Проблема в том, что для агента текст задачи и вредоносная инструкция приходят через один и тот же канал. Человеку комментарий может казаться справочной информацией, а модель способна воспринять его как команду. Значит, доверять входному контексту только потому, что он находится внутри корпоративного проекта, нельзя.

Microsoft 365 Copilot: письмо, которое не нужно открывать

Microsoft 365 Copilot работает с письмами, файлами и другими корпоративными данными, доступными пользователю. Исследователи нашли уязвимость EchoLeak, позволявшую влиять на поведение Copilot через специально подготовленное письмо.

Пользователю не требовалось открывать вложение или переходить по подозрительной ссылке. Copilot мог найти внутреннюю информацию и передать её атакующему без дополнительных действий со стороны человека.

Этот сценарий ломает привычную модель защиты, в которой опасное действие совершает сам пользователь. Если агент автоматически читает входящие данные и действует от имени человека, контроль нужен до выполнения операции, а не только в момент клика.

Что объединяет все пять случаев

Ни один из этих инцидентов нельзя свести только к «плохой модели». Риск появился на стыке модели, среды и выданных полномочий. В одном случае не сработала изоляция, в другом оказался слишком широким внешний доступ, в третьем уязвимость одного инструмента усилили возможности другого, а ещё в двух атака пришла через доверенный рабочий контекст.

Перед подключением агента к корпоративным системам стоит проверить четыре вещи:

  • Границы среды. Может ли агент выйти в интернет или обратиться к сервису, который не входит в задачу?
  • Минимальность прав. Нужны ли ему запись, запуск команд и доступ ко всему репозиторию, если задача требует только чтения?
  • Комбинацию инструментов. Как изменится риск, если разрешения нескольких коннекторов сложить вместе?
  • Контроль действий. Какие операции требуют отдельного согласия человека, а какие агент выполняет автоматически?

Главный принцип прост: чем ближе модель к реальным данным и действиям, тем меньше защита может полагаться на правильное поведение самой модели.

Бесплатный эфир о безопасности ИИ-агентов

Как не превратить агента в точку входа

20 августа в 19:00 МСК на бесплатном онлайн-эфире эти случаи обсудят Денис Макрушин, директор по продуктам безопасной разработки в Яндексе, и Глеб Михеев, технический директор направления генеративного ИИ в Сбере.

Это будет разговор двух лидеров индустрии с разбором реальных кейсов и ответами на вопросы участников.

Если вы подключаете агентов к коду, данным или рабочим инструментам и хотите сверить свой подход к их защите, можно зарегистрироваться на эфир.

AppSec GitHub Copilot Microsoft 365 Copilot безопасность ИИ ИИ ИИ-агенты
Alt text
Обращаем внимание, что все материалы в этом блоге представляют личное мнение их авторов. Редакция SecurityLab.ru не несет ответственности за точность, полноту и достоверность опубликованных данных. Вся информация предоставлена «как есть» и может не соответствовать официальной позиции компании.
АНТИПОВ
0 : 1
ПРАВДА VS НАГЛОСТЬ
ПРАВ
Быть правым —
самый бесполезный актив
Умные проигрывают наглым. Логика сливается инстинктам толпы. Статусу и бюджетам плевать на ваши факты.
АНТИПОВ РЕЖЕТ БЕЗ НАРКОЗА
реклама

CyberEd

Кибербезопасность – наш ключевой фокус. Мы накопили огромную экспертизу и умеем решать задачи любого уровня сложности