Конец света отменяется? OpenAI, Anthropic, Google и Meta* обещают контролировать свои модели

leer en español

3023
Конец света отменяется? OpenAI, Anthropic, Google и Meta* обещают контролировать свои модели

ИИ-компании согласились на четыре уровня контроля после серии тревожных инцидентов.

image

Крупнейшие разработчики искусственного интеллекта решили закрепить на бумаге правила, которые должны не дать самым мощным моделям выйти из-под контроля. OpenAI, Anthropic, Google, Meta*, Nvidia и xAI присоединились к добровольному соглашению Белого дома о безопасности ИИ.

Компании согласились выстроить четыре уровня контроля. Разработчики должны внедрить внутренние механизмы наблюдения за моделями, назначить отдельную команду для проверки этих механизмов, привлечь независимых внешних аудиторов и создать комитет при совете директоров. Похожую модель независимой проверки Anthropic уже начала внедрять вместе с Accenture.

Особое внимание участники соглашения обещают уделять возможностям ИИ в кибербезопасности, биологии и химии. В документе отдельно прописана задача не допускать ситуаций, когда модель взламывает или получает доступ к техническим системам способами, которых разработчики не планировали. Компании также договорились регулярно встречаться и уточнять общие стандарты безопасности.

Соглашение подписали президент OpenAI Грег Брокман, глава Anthropic Дарио Амодеи, руководитель Google Сундар Пичаи, глава Meta Марк Цукерберг, руководитель Nvidia Дженсен Хуанг и Илон Маск, представляющий xAI. Документ пока не создаёт юридически обязательных требований. Участники, однако, допускают, что со временем часть правил может перейти в законы или нормативные требования.

Повод для коллективного обещания появился вполне практический. За последние месяцы разработчики несколько раз признавали, что автономные агенты выходили за границы подготовленных испытательных сред и получали доступ к посторонним системам. В одном из экспериментов модель Meta случайно получила интернет-доступ и воспользовалась уязвимостью внешнего сервиса.

Риски уже не ограничиваются обычными ошибками чат-ботов. Более мощные модели способны искать уязвимости, писать эксплойты и выполнять длинные цепочки действий почти без участия человека. OpenAI, Anthropic и Google одновременно усиливают защиту от сценариев, связанных с биологическим оружием, поскольку новые поколения моделей всё лучше справляются со сложными научными задачами.

Дональд Трамп при этом сохранил курс на быстрое развитие отрасли и саморегулирование вместо жёсткого предварительного контроля со стороны государства. Президент США назвал соглашение чем-то вроде «конституции» для индустрии и сообщил, что рассматривает создание совета из десяти человек для надзора за безопасностью ИИ. Параллельно Белый дом готовится назначить нового чиновника, который будет отвечать за политику в сфере искусственного интеллекта.

Недоверие общества к нынешней системе контроля остаётся высоким. В проведённом 17–20 сентября опросе Reuters/Ipsos 73% американских респондентов выразили опасение, что ИИ-компании делают недостаточно для предотвращения серьёзного вреда обществу. Ещё 55% поддержали идею замедлить развитие технологии.

Новый пакт не заставляет разработчиков останавливать обучение мощных моделей и не вводит единый государственный механизм допуска перед релизом. Фактически компании договорились сделать контроль, аудит и ответственность руководства постоянной частью разработки. Ещё недавно сама попытка крупнейших лабораторий коллективно притормозить гонку вызывала опасения из-за возможных претензий по антимонопольному законодательству.

Anthropic уже пошла дальше общего обещания и договорилась с Accenture вложить не менее $2 млрд в систему, где внешние специалисты будут проверять передовые модели непосредственно в процессе разработки. Аудиторы получат возможность искать опасное поведение и оценивать защитные механизмы до выпуска систем.

OpenAI недавно впервые собрала собственные инциденты в отдельную публичную отчётность. Компания описала шесть случаев, когда модели скрывали ошибки, искали чужие ключи, публиковали файлы в интернете или самостоятельно выбирали способы обхода ограничений.

Похожая проблема проявилась и у Google. Во время испытаний Gemini покинула подготовленный полигон и проникла в системы трёх реальных компаний, приняв внешние серверы за часть задания. Подобные эпизоды хорошо объясняют, почему обещание «контролировать ИИ» теперь включает не только фильтры ответов, но и аудит реальных действий автономных агентов.

* Компания Meta и её продукты, включая Instagram, Facebook и Threads, признаны экстремистскими, их деятельность запрещена на территории РФ.