Кремниевой долине предлагают перестать чинить самые опасные ошибки уже после запуска. Бывший сотрудник команды безопасности OpenAI Дэвид Робинсон написал, что передовым ИИ-системам нужны процедуры и резервные уровни защиты, сопоставимые с атомной энергетикой и авиацией, где единственный неверный шаг не должен превращаться в необратимую аварию.
Робинсон покинул OpenAI после трёх с половиной лет работы. Специалист руководил подготовкой отчётов о безопасности для 12 запусков передовых моделей и участвовал в разработке действующего Preparedness Framework, который определяет, как компания оценивает наиболее серьёзные риски. Причиной ухода стала не отдельная техническая ошибка, а темп разработки и сама культура принятия решений.
Главная претензия касается подхода iterative deployment. OpenAI постепенно выпускает новые системы, наблюдает за реальным поведением и усиливает ограничения после выявленных проблем. Такой цикл помогал развивать продукты при меньших возможностях моделей, но Робинсон считает его слишком рискованным для систем, способных самостоятельно искать обходные пути и действовать через внешние инструменты.
В качестве примера Робинсон напомнил летние инциденты с автономными агентами OpenAI. После взлома инфраструктуры Hugging Face компания усилила изоляцию, однако позднее другой агент сам нашёл непрямой канал во внешний интернет через DNS. Побег агента заметил мониторинг, но автоматическая остановка не сработала, и запуск пришлось завершать вручную.
Предлагаемая модель безопасности строится на принципе, знакомом атомным станциям и авиации. Система должна выдерживать отказ оборудования, ошибку оператора или неверную настройку без катастрофического результата. Для передовых ИИ Робинсон предлагает многослойную защиту, длительное планирование и независимую проверку до запуска, а не только быстрое исправление уже обнаруженных сбоев.
Отдельная проблема связана с выравниванием поведения моделей, то есть с попыткой добиться устойчивого соответствия человеческим целям и ограничениям. По оценке Робинсона, возможности ИИ растут быстрее, чем методы проверки такого соответствия. Недавний призыв к стандартам со стороны OpenAI и Anthropic показывает, что похожие вопросы уже вышли за пределы внутренних процедур компаний.
OpenAI отвергает вывод о недостаточной осторожности. Компания заявила, что не позволяет возможностям моделей выходить за пределы управляемого уровня, а при необходимости приостанавливает обучение или откладывает выпуск. Спор теперь касается не самого наличия защитных мер, а того, достаточно ли нынешнего темпа проверок для систем с быстро растущей автономностью.
