Защита популярных ИИ-моделей от обхода ограничений отличается в десятки и даже сотни раз. Пока одни системы успешно блокируют опасные запросы, другие удаётся сравнительно дёшево заставить выдавать инструкции для кибератак и создания оружия массового поражения. К такому выводу пришли специалисты организации FAR.AI, представившие первый рейтинг защищённости современных языковых моделей.
Авторы отчёта сравнили четыре флагманские модели. Проверку прошли Grok 4.5, Gemini 3.1 Pro, Claude Fable 5 и GPT-5.6 Sol. Специалисты сосредоточились на попытках обойти встроенные ограничения при запросах, связанных с химическим, биологическим, радиологическим и ядерным оружием, взрывчатыми веществами, а также наступательными кибератаками.
Наихудший результат показал Grok 4.5. Во время автоматического поиска удалось обнаружить 63 универсальных способа обхода защиты, а при участии специалистов число выросло до 385. По оценке авторов исследования, поиск одного такого метода обходится примерно в 58 долларов. Gemini 3.1 Pro оказался заметно устойчивее, но также продемонстрировал серьёзные проблемы. Для модели нашли 18 универсальных способов обхода автоматически и 231 при ручном подборе, а средняя стоимость поиска составила около 278 долларов.
Claude Fable 5 и GPT-5.6 Sol, напротив, не позволили обнаружить ни одного универсального способа обхода ни автоматическим поиском, ни при участии специалистов. Авторы подчёркивают, что такой результат не означает абсолютную безопасность, однако говорит о более высокой устойчивости к распространённым методам обхода защитных механизмов.
В FAR.AI также представили собственный минимальный стандарт защиты. По мнению организации, современные модели должны как минимум противостоять широко известным и общедоступным методам обхода. Если разработчик не обеспечивает даже такой уровень защиты, система не соответствует современным требованиям безопасности и может сравнительно легко начать выполнять опасные запросы, связанные с кибератаками или оружием массового поражения.
Авторы объясняют разницу тем, что злоумышленники всегда ищут самое слабое звено. Если одна модель отказывается выполнять опасный запрос, злоумышленник может просто перейти к другой, где ограничения реализованы слабее. По мнению специалистов, разработчикам необходимо использовать сразу несколько независимых уровней защиты, которые проверяют входящие запросы, процесс рассуждений модели и формируемые ответы. Такой подход позволит снизить вероятность успешного обхода ограничений, даже если один из механизмов откажет.