17 из 32. «Убийца Fable 5» эпично провалил экзамен на виртуального взломщика

leer en español

23273
17 из 32. «Убийца Fable 5» эпично провалил экзамен на виртуального взломщика

Громкая репутация рассыпалась при первом серьёзном столкновении с реальностью.

image

Способность ИИ самостоятельно искать путь ко взлому всё чаще проверяют не на отдельных задачах, а на полноценных цепочках атак, и новая Kimi K3 пока заметно уступает в этом ведущим американским моделям. К такому предварительному выводу пришли Институт безопасности искусственного интеллекта Великобритании и Центр стандартов и инноваций в сфере ИИ США после совместной оценки модели Moonshot AI.

В тесте ExploitBench Kimi K3 пыталась создавать рабочие способы эксплуатации 41 уязвимости движка V8, который используется в Chrome. Модель набрала 32% и обошла GLM-5.2 с результатом 24%, но ни разу не смогла довести атаку до произвольного выполнения кода. Наиболее сильные модели достигали такого результата в среднем в 20 из 41 задания.

Второй тест проходил в учебной корпоративной сети The Last Ones. Сценарий включает 32 последовательных этапа атаки, четыре подсети и около 20 узлов. Kimi K3 в среднем дошла до 17-го этапа, GLM-5.2 достигла 11-го, а ведущие американские модели проходили в среднем 28,5 этапа.

В одной из десяти попыток Kimi K3 всё же завершила весь сценарий в пределах установленного лимита. Результат показывает, что модель способна автономно атаковать небольшую, слабо защищённую и уязвимую корпоративную сеть после получения начального доступа. Однако тестовая среда не воспроизводит реальные условия полностью. В ней нет активной защиты, средства обнаружения не мешают атаке, а последовательность уязвимостей подготовлена заранее.

Проверка также показала, что защитные механизмы Kimi K3 не остановили попытки создавать эксплойты и проводить наступательные операции. Американские модели тестировали с отключёнными системными ограничениями, чтобы измерить максимальные возможности, тогда как публичные версии обычно работают с включённой защитой.

Авторы называют выводы предварительными. Kimi K3 проверили только на ограниченном наборе открытых и закрытых тестов, а общую оценку построили главным образом по ExploitBench. Тем не менее результаты показывают текущее соотношение возможностей различных LLM: Kimi K3 обошла ближайшего открытого конкурента, но до ведущих закрытых моделей ей пока далеко.