Инструкция по созданию ядерной бомбы за 58 долларов. Эксперты составили первый рейтинг уязвимости нейросетей

6152
Инструкция по созданию ядерной бомбы за 58 долларов. Эксперты составили первый рейтинг уязвимости нейросетей

FAR.AI представила первый рейтинг защищённости языковых моделей от обхода ограничений.

image

Защита популярных ИИ-моделей от обхода ограничений отличается в десятки и даже сотни раз. Пока одни системы успешно блокируют опасные запросы, другие удаётся сравнительно дёшево заставить выдавать инструкции для кибератак и создания оружия массового поражения. К такому выводу пришли специалисты организации FAR.AI, представившие первый рейтинг защищённости современных языковых моделей.

Авторы отчёта сравнили четыре флагманские модели. Проверку прошли Grok 4.5, Gemini 3.1 Pro, Claude Fable 5 и GPT-5.6 Sol. Специалисты сосредоточились на попытках обойти встроенные ограничения при запросах, связанных с химическим, биологическим, радиологическим и ядерным оружием, взрывчатыми веществами, а также наступательными кибератаками.

Наихудший результат показал Grok 4.5. Во время автоматического поиска удалось обнаружить 63 универсальных способа обхода защиты, а при участии специалистов число выросло до 385. По оценке авторов исследования, поиск одного такого метода обходится примерно в 58 долларов. Gemini 3.1 Pro оказался заметно устойчивее, но также продемонстрировал серьёзные проблемы. Для модели нашли 18 универсальных способов обхода автоматически и 231 при ручном подборе, а средняя стоимость поиска составила около 278 долларов.

Claude Fable 5 и GPT-5.6 Sol, напротив, не позволили обнаружить ни одного универсального способа обхода ни автоматическим поиском, ни при участии специалистов. Авторы подчёркивают, что такой результат не означает абсолютную безопасность, однако говорит о более высокой устойчивости к распространённым методам обхода защитных механизмов.

В FAR.AI также представили собственный минимальный стандарт защиты. По мнению организации, современные модели должны как минимум противостоять широко известным и общедоступным методам обхода. Если разработчик не обеспечивает даже такой уровень защиты, система не соответствует современным требованиям безопасности и может сравнительно легко начать выполнять опасные запросы, связанные с кибератаками или оружием массового поражения.

Авторы объясняют разницу тем, что злоумышленники всегда ищут самое слабое звено. Если одна модель отказывается выполнять опасный запрос, злоумышленник может просто перейти к другой, где ограничения реализованы слабее. По мнению специалистов, разработчикам необходимо использовать сразу несколько независимых уровней защиты, которые проверяют входящие запросы, процесс рассуждений модели и формируемые ответы. Такой подход позволит снизить вероятность успешного обхода ограничений, даже если один из механизмов откажет.