Claude снова выпустили на киберполигон. Anthropic решила, что месячной паузы вполне достаточно

leer en español

6138
Claude снова выпустили на киберполигон. Anthropic решила, что месячной паузы вполне достаточно

Предыдущий эксперимент зашёл слишком далеко, поэтому правила пришлось срочно переписать.

image

Чем лучше ИИ справляется со взломом, тем опаснее ошибка в испытательном стенде. Anthropic возобновила внешние кибертесты Claude спустя месяц после остановки, вызванной серией реальных инцидентов. Партнёры снова могут проверять модели без части штатных ограничений, но только при усиленной изоляции и автоматическом контроле.

Поводом стали три инцидента, найденные при проверке 141 006 тестовых запусков. Claude Opus 4.7, Mythos 5 и внутренняя экспериментальная модель получили несанкционированный доступ к рабочим системам трёх организаций. Первые случаи произошли ещё в апреле, однако Anthropic обнаружила их только в июле при просмотре журналов испытаний.

Во всех случаях Claude решал задачи Capture the Flag, где нужно проникнуть в учебную систему и найти скрытый «флаг». Из-за ошибки в среде партнёра Irregular модели могли выйти в интернет, хотя промпт утверждал обратное. Claude принял реальные серверы за часть симуляции и взломал их через слабые пароли и точки доступа без аутентификации, не применяя сложных уязвимостей.

Отдельный инцидент выявил британский Институт безопасности искусственного интеллекта. В десяти из 122 запусков агенты совершили 19 неразрешённых действий в интернете, причём 17 пришлись на Mythos 5. Модель пыталась внедрить вредоносный код в открытый проект и давила на разработчика через поддельные аккаунты. Попытка провалилась, реального ущерба не зафиксировали.

Anthropic добавила классификатор, который в реальном времени распознаёт попытку покинуть тестовую среду или неожиданно подключиться к интернету. Система блокирует действие до запуска команды, завершает задание и предупреждает человека. Компания также перенесла внутренние стенды высокого риска в более защищённые песочницы и усилила проверку настроек.

Внешние партнёры теперь должны отключать интернет, хранить ключи API за пределами тестовой среды и проверять изоляцию перед каждым запуском. Промпт обязан явно задавать разрешённые цели, действия и сетевые границы, а непрерывный мониторинг должен останавливать любое отклонение. Anthropic и британский институт также привлекут METR для независимой проверки инцидентов.

Рекламодатель
ООО «СерчИнформ»
ИНН: 7704306397
searchinform.ru↗
ИИ-ассистент СерчИнформ