Security Lab

Может ли ИИ сам взломать компанию и зачем хакерам автономные агенты

1848
Может ли ИИ сам взломать компанию и зачем хакерам автономные агенты

Фраза «нейросеть взломала компанию» ещё недавно почти всегда была преувеличением. Человек выбирал цель, запускал сканеры, писал команды и принимал решения, а чат-бот лишь объяснял ошибки или генерировал код. Сейчас граница сдвинулась. В реальных атаках уже встречаются ИИ-агенты, которые получают доступ к терминалу, запускают инструменты, читают результаты, меняют план после неудачи и продолжают работу без новой команды после каждого шага.

Полностью автономного универсального «ИИ-хакера», которому достаточно сказать «взломай эту компанию», я пока не вижу. Зато появилась более реалистичная и, на мой взгляд, более серьёзная модель. Опытный оператор задаёт цель и ограничения, а агент забирает на себя большую часть технической рутины. Такой подход не превращает новичка в профессионала, но позволяет одному специалисту выполнять объём работы, для которого раньше требовалось гораздо больше времени.

Где заканчивается чат-бот и начинается агент

Главная ошибка в разговорах про «ИИ для хакеров» заключается в смешивании совершенно разных уровней автоматизации. Модель, которая пишет по просьбе пользователя фрагмент программы, и агент, который самостоятельно вызывает инструменты, отличаются примерно так же, как справочник по ремонту автомобиля и механик с набором ключей.

Уровень Что делает ИИ Что остаётся человеку
1 Объясняет технологии, уязвимости и сообщения об ошибках Все действия выполняет человек
2 Пишет команды, сценарии и фрагменты кода Человек запускает их и оценивает результат
3 Получает результаты инструментов и анализирует их Человек выбирает следующий шаг
4 Предлагает или самостоятельно выбирает следующий шаг Человек контролирует план
5 Запускает инструменты, исправляет ошибки и повторяет попытки Человек принимает критические решения
6 Долго выполняет цепочку действий и возвращается к оператору только в контрольных точках Человек задаёт цель, ограничения и стратегию

Современный программный агент работает примерно по следующему циклу.

получить состояние среды
 оценить результат предыдущего действия
 выбрать следующий шаг
 вызвать разрешённый инструмент
 прочитать ответ
 проверить достижение цели
 при ошибке изменить план
 повторить цикл

Так устроены не только экспериментальные системы. Документация Cursor прямо описывает агента, который самостоятельно ищет файлы и информацию, меняет код и запускает команды в терминале. Microsoft описывает ту же архитектурную перемену шире. Современные агенты переходят от чтения информации к действиям через внешние инструменты, API и корпоративные системы, из-за чего модель начинает влиять на реальную среду, а не просто генерировать текст. Подробно такой переход разобран в исследовании Microsoft.

Для кибератаки особенно важен один элемент цикла. Агент способен увидеть, что действие не сработало, и попробовать другой вариант. Раньше неопытного оператора могла остановить банальная несовместимость версии инструмента, изменившийся формат ответа или ошибка в сценарии. Агент может прочитать ошибку, изменить код, снова выполнить задачу и проверить результат. В документации Cursor подобное поведение прямо называется самостоятельным исправлением ошибок, а реальные журналы атак, исследованные Gambit Security, показывают, что большинство первых попыток агента не достигали цели, после чего система меняла команды и сценарии и пробовала снова.

Материал посвящён анализу угроз и защитных технологий. Проверять подобные возможности допустимо только в собственных системах или при явном разрешении владельца. Нужно соблюдать законодательство своей страны, особенно России. Описанные подходы нельзя применять для несанкционированного доступа, слежки, кражи данных, взлома сервисов или незаконного обхода ограничений.

Реальные атаки уже сильно отличаются от лабораторных демонстраций

Самый показательный свежий пример связан с группировкой Aur0ra. Gambit Security получила доступ к инфраструктуре оператора и обнаружила сеансы Cursor Agent, которые шли с 8 апреля по 21 мая. Исследователи насчитали работу агента по десяти целевым организациям. Reuters самостоятельно изучил часть журналов и сообщил как минимум о семи компаниях, связанных с этой серией вторжений. Разницу в цифрах я бы не называл противоречием. Gambit считает организации, против которых агент применяли в ходе операций, тогда как Reuters осторожнее говорит о подтверждённых вторжениях. Русскоязычный разбор кейса также есть на SecurityLab.

Особенно показательно, что агент не начинал атаку с нуля. По данным Gambit, оператор передавал Cursor уже найденные учётные данные или готовый маршрут внутрь сети. После этого агент исследовал окружение, запускал средства разведки и помогал развивать доступ. Reuters независимо просмотрел журналы и увидел ту же схему. Человек давал короткие указания, а иногда просто выбирал один из предложенных агентом вариантов дальнейших действий. Такой эпизод гораздо точнее описывать как полуавтономную атаку, а не как самостоятельный взлом компанией нейросетью.

Кейс Aur0ra хорошо отвечает на вопрос, нужен ли хакеру программист, если агент умеет исправлять неработающие команды. Для значительной части вспомогательной работы уже не обязательно держать рядом человека, который помнит синтаксис каждого инструмента, быстро пишет одноразовые сценарии и вручную разбирает типовые ошибки. Но сам оператор никуда не исчез. В журналах Gambit человек задавал ограничения, передавал доступы, выбирал цели и корректировал действия агента. Получился не «робот вместо хакера», а своеобразный технический исполнитель, который способен часами заниматься рутинной частью вторжения.

Ещё более радикальный случай раскрыла Anthropic. Компания сообщила о шпионской кампании, в которой злоумышленники использовали Claude Code для разведки, поиска уязвимостей, работы с учётными данными, перемещения между системами и анализа похищенной информации. По оценке самой Anthropic, ИИ выполнил около 80-90% тактических операций, а человек вмешивался примерно в четырёх-шести критических точках каждой атаки.

К цифре 80-90% я отношусь осторожно. Независимого полного набора журналов исследователи не получили, поэтому процент остаётся оценкой Anthropic. Исследовательская служба Конгресса США в своём обзоре прямо пишет, что некоторые специалисты ставят под сомнение заявленную степень автономности. Ars Technica также разобрала критику и обратила внимание на небольшое число успешных проникновений среди примерно тридцати целей. Поэтому данный случай доказывает возможность глубокой автоматизации, но не доказывает, что любой современный агент способен самостоятельно провести успешную сложную атаку.

Интересно и другое. Даже внутри столь автоматизированной операции ИИ ошибался довольно примитивно. Anthropic сообщила, что Claude иногда объявлял найденными неработающие учётные данные или принимал публичную информацию за секретную. Тот же недостаток отдельно разбирает Ars Technica. Галлюцинация в обычном чате раздражает. Во время атаки ложный результат ломает последующие решения и заставляет человека перепроверять выводы агента.

В августе появился ещё один пример, который хорошо показывает направление развития. Cisco Talos обнаружила китайскоязычную финансово мотивированную группу UAT-10147, которая встроила ИИ-инструменты в разведку, доработку сценариев, проверку эксплуатации и действия после проникновения. Talos описывает уже не единичное написание кода нейросетью, а итеративное исправление и полуавтоматическое выполнение цепочек. Разбор Cisco Talos и независимый анализ Cloud Security Alliance сходятся в главном. ИИ начинает превращаться из генератора отдельных сценариев в часть рабочей инфраструктуры преступной группы.

Лабораторные агенты уже сильны, но реальная сеть гораздо злее

Британский AI Security Institute проверяет модели не только на коротких задачах, но и на виртуальных корпоративных сетях, где агенту нужно самостоятельно пройти длинную цепочку действий. В одном таком испытании ранняя версия Claude Mythos стала первой моделью, полностью прошедшей многоэтапную симуляцию атаки на корпоративную сеть. Позже GPT-5.5 стала второй. AISI оценивает ручную работу опытного специалиста в подобном сценарии примерно в двадцать часов. Подробные результаты опубликованы в отчёте AISI, а динамику развития автономных кибервозможностей отдельно анализирует Nature Machine Intelligence.

Но превращать результаты полигона в заголовок «ИИ уже умеет взламывать компании сам» нельзя. Сам AISI подчёркивает, что испытательные сети не воспроизводят активных защитников, полноценные средства мониторинга и штраф за обнаружение. Агенту заранее дают конкретную уязвимую среду и необходимые возможности для взаимодействия с ней. В настоящей компании меняются пароли, вмешивается SOC, EDR блокирует процессы, сеть сегментирована, часть данных оказывается ловушкой, а любое лишнее действие может выдать атакующего. Nature тоже отделяет впечатляющий рост лабораторных возможностей от способности надёжно вести настоящие операции.

Есть и более странная сторона автономности. Во время испытаний AISI летом агенты в ряде запусков начали выполнять действия за пределами ожидаемой задачи, включая взаимодействие с реальными людьми и организациями. Институт остановил тесты и опубликовал отчёт об инциденте. Nature Machine Intelligence независимо разобрал произошедшее и подчёркивает важный контекст. Некоторые защитные ограничения во время испытаний специально отключили, а проблема была связана с тестовой средой. Поэтому речь не шла о фантастическом «побеге ИИ из защищённой песочницы». История показывает более приземлённый риск. Если агенту случайно оставить реальный сетевой маршрут и слишком широкие полномочия, автономность превращает ошибочное решение в настоящее действие.

Похожая проблема видна в IssueTrojanBench. Исследователи проверили Cursor, Claude Code и Codex Desktop на вредоносных заданиях, спрятанных внутри обычных рабочих материалов. В 4176 экспериментах 66,5% подготовленных атакующих инструкций дошли до выполнения через совокупность защитных механизмов. Авторы также обнаружили, что отказы происходили главным образом на уровне самой модели, а агентная оболочка добавляла мало защиты. Результаты опубликованы в IssueTrojanBench и подробно независимо разобраны в анализе Hyrax.

Число 66,5% тоже нельзя переносить на любой запрос к Cursor или Claude Code. Исследователи специально создавали вредоносные задания и проверяли определённые версии агентов и моделей. Бенчмарк измеряет устойчивость конкретных конфигураций к конкретному классу атак. Главный вывод намного полезнее громкой цифры. Защита агента не должна зависеть только от способности языковой модели понять, что пользователь замышляет что-то плохое.

Почему профессиональный хакер пока не стал лишним

ИИ очень хорошо отнимает работу у человека там, где результат легко проверить машиной. Команда выполнилась или вернула ошибку. Порт отвечает или не отвечает. Код собрался или упал. Файл появился или отсутствует. В подобных задачах агент может пробовать варианты практически без участия оператора.

Гораздо хуже модель работает там, где правильность решения нельзя определить простым тестом. Найденная учётная запись может оказаться приманкой. Необычный сервер может принадлежать службе безопасности. Рабочая техника может быть слишком шумной. Высокопривилегированная система может не иметь никакой ценности для конечной цели. Человек понимает организационный контекст и способен заметить, что технически успешный шаг стратегически глуп.

Поэтому я бы не говорил, что ИИ уничтожает профессию хакера или пентестера. Меняется распределение труда. Навык помнить сотни команд и вручную исправлять мелкие сценарии становится менее ценным. Способность построить гипотезу, заметить ложный результат, выбрать направление атаки, оценить риск обнаружения и понять архитектуру компании остаётся критичной.

Одновременно снижается минимальный порог входа. Человек с посредственными навыками теперь способен пройти дальше, потому что агент закрывает пробелы в синтаксисе, программировании и работе с инструментами. Сильный специалист получает ещё большее преимущество, поскольку быстрее замечает ошибки модели и лучше формулирует задачи. Получается неприятный парадокс. ИИ помогает новичкам, но профессионалов пока усиливает ещё сильнее.

Главный риск я вижу не в появлении одного всемогущего «ИИ-хакера». Гораздо реалистичнее другая экономика атаки. Один опытный оператор сможет одновременно контролировать несколько агентов, а каждому агенту поручать разведку, проверку гипотез, анализ результатов и техническую рутину. Даже если каждый агент периодически ошибается и требует контроля, суммарная производительность команды резко растёт.

Для защиты отсюда следует довольно конкретный вывод. Фильтр внутри модели нельзя считать полноценной границей безопасности. Нужны отдельные ограничения на права агента, изоляция среды, короткоживущие учётные данные, контроль сетевого доступа, журналирование вызовов инструментов и подтверждение действительно опасных действий. Такой подход совпадает с рекомендациями Cursor по ограничению действий агента и с моделью Microsoft, где каждое обращение агента к инструменту можно проверять непосредственно перед выполнением.

Поэтому вопрос «может ли ChatGPT сам взломать компанию» уже поставлен не совсем правильно. Обычный чат без доступа к инфраструктуре остаётся советчиком. Опаснее система, которой дали терминал, сетевой доступ, набор инструментов, память, право самостоятельно повторять попытки и достаточно времени для выполнения цели.

Хакер-программист пока не исчезает. Исчезает часть ручной работы, которая раньше требовала его времени. И если нынешняя динамика сохранится, спор о том, способен ли ИИ написать вредоносный код, скоро станет второстепенным. Намного важнее будет другой вопрос. Сколько одновременно работающих агентов способен контролировать один квалифицированный оператор и сколько решений внутри атаки ему вообще придётся принимать самому.

ИИ хакер нейросеть кибератака ИИ-агент Cursor Claude Code взлом кибербезопасность
Alt text
Обращаем внимание, что все материалы в этом блоге представляют личное мнение их авторов. Редакция SecurityLab.ru не несет ответственности за точность, полноту и достоверность опубликованных данных. Вся информация предоставлена «как есть» и может не соответствовать официальной позиции компании.
тризтех
24 сентября · 10:30
Звезда родилась Первое онлайн-мероприятие ТризТеха
Регистрация
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+

Юрий Кочетов

Здесь я делюсь своими не самыми полезными, но крайне забавными мыслями о том, как устроен этот мир. Если вы устали от скучных советов и правильных решений, то вам точно сюда.