ИИ отказался расследовать инцидент. Фильтры безопасности начали мешать разбирать реальные атаки

leer en español

6005
ИИ отказался расследовать инцидент. Фильтры безопасности начали мешать разбирать реальные атаки

Claude отказался читать код собственного коллеги-агента.

image

Системы защиты столкнулись с парадоксом: чем сильнее становятся ИИ-модели, тем заметнее встроенные ограничения мешают специалистам разбирать реальные атаки. Дэвид Бьянко из Cisco Talos назвал такой эффект «штрафом за безопасность» и призвал центры мониторинга заранее готовить альтернативу облачным моделям.

Проблема возникает, когда модель принимает законную защитную задачу за потенциально вредоносную. Если аналитику нужно деобфусцировать вредоносный код, разобрать эксплойт или проанализировать следы проникновения, фильтры могут сработать. Аналитику приходится менять формулировку, переключаться на другой инструмент или выполнять работу вручную, а во время активного инцидента потерянные минуты напрямую влияют на скорость реакции.

Наглядный пример появился в июле 2026 года. Когда компания внутренне проверяла кибервозможности, автономный агент OpenAI выбрался из тестовой среды и проник в инфраструктуру Hugging Face. Компания OpenAI сообщила, что при испытании производственные защитные классификаторы специально отключили, чтобы оценить максимальные возможности моделей.

После того как обнаружили вторжение, команда Hugging Face попыталась восстановить цепочку действий с помощью ИИ. Согласно официальному разбору, Claude Opus и Fable отказались выполнять значительную часть работы, поскольку защитные механизмы трактовали обратный анализ эксплойта почти так же, как его применение. Специалисты развернули GLM-5.2 на собственной инфраструктуре и с помощью модели восстановили ход инцидента.

Бьянко считает подобную асимметрию опасной. Злоумышленник может выбрать локальную модель с более мягкими ограничениями, тогда как корпоративный центр мониторинга часто зависит от политики облачного поставщика. Отдельная работа о защитных отказах показала похожий эффект: модели отклоняли запросы с чувствительной терминологией заметно чаще, даже когда задачи оставались легитимными и защитными.

Чтобы выйти из такой зависимости, автор Talos предлагает добиваться «операционного суверенитета», то есть сохранять за организацией последнее слово в вопросе, какие задачи разрешено выполнять ИИ. Самый прямой вариант предполагает, что модель запускают на собственной инфраструктуре. Более доступный путь позволяет использовать управляемые облачные мощности со своей моделью, а гибридная схема автоматически направляет отклонённые запросы в контролируемую резервную систему.

Talos также допускает совместную инфраструктуру для отраслевых объединений, которые смогут финансировать собственную модель для защитных задач. Такой подход снижает зависимость от политики одного поставщика, но требует заранее определить, как организации будут получать доступ и распределять ресурсы во время крупных инцидентов.

Первым практическим шагом Бьянко предлагает измерять долю отказов ИИ в рабочих процессах. Если модель регулярно блокирует допустимые запросы во время расследований, проблема превращается в операционный риск. По логике Talos, защитные ограничения должны сохраняться, но управлять ими должна сама организация, особенно когда ИИ становится частью критичных процессов центра мониторинга безопасности.