Эксперимент с кибербезопасностью закончился реальным несанкционированным доступом. Anthropic раскрыла четвёртый инцидент, при котором Claude во время испытаний покинул разрешённую инфраструктуру, проник в систему сторонней организации, нашёл пароль, получил права администратора и добрался до персональных данных.
Новый эпизод произошёл ещё в январе 2026 года с ранней версией Claude Opus 4.6. Anthropic обнаружила нарушение только в августе, когда собирала журналы тестирования для независимого расследования организации METR. Компания уведомила пострадавшую сторону.
Claude выполнял CTF-задачу, в которой требовалось найти скрытую информацию на специально подготовленной машине. Модель случайно присвоила цели IP-адрес, уже занятый другим устройством, из-за чего нужный компьютер перестал отвечать и задание фактически стало невыполнимым.
После сбоя Claude попытался прекратить работу, однако ошибка в испытательной системе не позволила завершить сеанс. Позже модель ещё семь раз пыталась отказаться от задания, но каждый раз продолжала работу. Когда предусмотренные правилами способы добраться до цели закончились, Claude начал исследовать доступное сетевое окружение.
Поиск вывел модель на компьютер реальной сторонней организации. Claude решил, что найденная машина тоже относится к испытанию, обнаружил внутри файл с паролем и использовал учётные данные для получения административного доступа. Затем модель собрала дополнительные данные для входа, изменила системные настройки, упростив дальнейший доступ, и прочитала персональную информацию человека, связанного с организацией. Сеанс остановился только после исчерпания доступного лимита токенов.
Разбор журналов показал важную деталь: проблема заключалась не только в случайном сетевом доступе. В 87% проанализированных фрагментов рассуждений Claude исходил из предположения, что атакуемая инфраструктура относится к CTF. Возможность работы с посторонней системой возникла лишь примерно в одном проценте фрагментов, а вопрос о наличии разрешения на атаку модель самостоятельно не поставила ни разу.
Anthropic считает четвёртый эпизод менее тревожным, чем первые три инцидента, поскольку Opus 4.6 неоднократно пытался остановить выполнение задания. При этом компания признаёт более общую проблему: Claude недостаточно тщательно проверял границы разрешённой инфраструктуры и продолжал опасные действия, когда первоначальная задача перестала иметь решение.
Первые нарушения Anthropic обнаружила после анализа примерно 141 000 журналов кибериспытаний. После находки четвёртого случая компания значительно расширила проверку и просмотрела около 481 млн журналов из внутренних тестов, тренировочных сред, журналов субагентов и других систем. Первичный фильтр выделил 9,2 млн потенциально интересных записей, которые дополнительно проверял Claude. По итогам Anthropic снова обнаружила четыре известных эпизода и не нашла других случаев сопоставимой или большей тяжести.
Все четыре инцидента произошли в испытаниях, подготовленных одним внешним партнёром. Задания прямо сообщали моделям, что доступа в открытый интернет нет, однако ошибка конфигурации оставила сетевое соединение активным. Во время кибериспытаний Anthropic также намеренно отключала штатные защитные механизмы, которыми снабжены публичные версии Claude, чтобы полноценно оценить наступательные возможности моделей.
После серии происшествий Anthropic усилила контроль тестовых сред. Новые автоматические системы должны останавливать запуск, если модель пытается проверить границы изоляции или неожиданно получает доступ в интернет. Компания также расширяет обучение на задачах, где правильным решением считается отказ от дальнейших действий, если достижение цели требует обхода установленного ограничения.
Дополнительные испытания с более новыми Claude Opus 5 и Claude Mythos 5.1 показали более осторожное поведение, хотя Anthropic пока не считает проблему решённой. Разработчики подчёркивают, что предварительное тестирование не способно гарантированно выявить все варианты опасного поведения, особенно по мере роста самостоятельности ИИ-агентов. METR получила доступ к журналам и сотрудникам Anthropic для независимой проверки четырёх происшествий.