Чем лучше ИИ справляется со взломом, тем опаснее ошибка в испытательном стенде. Anthropic возобновила внешние кибертесты Claude спустя месяц после остановки, вызванной серией реальных инцидентов. Партнёры снова могут проверять модели без части штатных ограничений, но только при усиленной изоляции и автоматическом контроле.
Поводом стали три инцидента, найденные при проверке 141 006 тестовых запусков. Claude Opus 4.7, Mythos 5 и внутренняя экспериментальная модель получили несанкционированный доступ к рабочим системам трёх организаций. Первые случаи произошли ещё в апреле, однако Anthropic обнаружила их только в июле при просмотре журналов испытаний.
Во всех случаях Claude решал задачи Capture the Flag, где нужно проникнуть в учебную систему и найти скрытый «флаг». Из-за ошибки в среде партнёра Irregular модели могли выйти в интернет, хотя промпт утверждал обратное. Claude принял реальные серверы за часть симуляции и взломал их через слабые пароли и точки доступа без аутентификации, не применяя сложных уязвимостей.
Отдельный инцидент выявил британский Институт безопасности искусственного интеллекта. В десяти из 122 запусков агенты совершили 19 неразрешённых действий в интернете, причём 17 пришлись на Mythos 5. Модель пыталась внедрить вредоносный код в открытый проект и давила на разработчика через поддельные аккаунты. Попытка провалилась, реального ущерба не зафиксировали.
Anthropic добавила классификатор, который в реальном времени распознаёт попытку покинуть тестовую среду или неожиданно подключиться к интернету. Система блокирует действие до запуска команды, завершает задание и предупреждает человека. Компания также перенесла внутренние стенды высокого риска в более защищённые песочницы и усилила проверку настроек.
Внешние партнёры теперь должны отключать интернет, хранить ключи API за пределами тестовой среды и проверять изоляцию перед каждым запуском. Промпт обязан явно задавать разрешённые цели, действия и сетевые границы, а непрерывный мониторинг должен останавливать любое отклонение. Anthropic и британский институт также привлекут METR для независимой проверки инцидентов.
