$2 млрд на людей, которые будут искать, где ИИ сорвётся с поводка

leer en español

11424
$2 млрд на людей, которые будут искать, где ИИ сорвётся с поводка

Anthropic решила пустить чужих аудиторов прямо в разработку Claude.

image

Anthropic и Accenture решили создать систему независимой проверки передовых моделей искусственного интеллекта и рассчитывают совместно вложить в неё не менее $2 млрд за пять лет. Проверяющие получат доступ к разработке Claude почти на уровне сотрудников Anthropic, чтобы наблюдать за обучением моделей, искать опасное поведение и оценивать работу защитных механизмов.

Каждая компания планирует направить на новое направление как минимум $1 млрд. Партнёрство возглавит специализированное подразделение Accenture Faculty. Его специалисты будут испытывать модели, проводить проверки красной командой, оценивать соответствие поведения ИИ заданным целям и проверять защиту от опасных действий.

Главное отличие нового подхода от обычного внешнего аудита заключается в глубине доступа. Независимые специалисты смогут наблюдать за моделью ещё во время обучения, изучать решения о её разработке и выпуске, общаться с сотрудниками и проверять, выполняет ли Anthropic собственные обязательства по безопасности. По замыслу компании, такая схема должна помогать замечать проблемы до выхода модели к пользователям, а не разбирать последствия уже после запуска.

При этом независимость проверки пока имеет важную оговорку. Anthropic будет напрямую оплачивать работу Accenture, а общепринятых правил для подобных проверяющих пока нет. Не определено, какие внутренние сведения им обязательно должны раскрывать, какие результаты можно публиковать и каким образом финансировать аудит так, чтобы заказчик не влиял на проверяющую сторону. В долгосрочной перспективе Anthropic предлагает перейти к общим фондам или государственному финансированию.

Компании не собираются ограничивать систему одним партнёром. Anthropic ведёт переговоры с некоммерческой организацией METR и другими проверяющими, а в ближайшие недели обещает назвать дополнительные группы. Accenture, в свою очередь, сможет проводить аналогичные проверки для других разработчиков ИИ.

Решение появилось после серии инцидентов во время испытаний автономных возможностей Claude. Летом Anthropic признала, что несколько моделей во время проверок получили доступ к реальным компьютерным системам за пределами предполагаемой испытательной среды. В нескольких случаях интернет оказался доступен из-за ошибок в настройке сторонней инфраструктуры, хотя модели должны были работать в изолированной среде.

После разбора происшествий Anthropic усилила изоляцию испытательных систем, добавила автоматическое обнаружение попыток выйти за заданные границы и расширила наблюдение за действиями ИИ. Компания также признала, что одних технических ограничений недостаточно: модель может настойчиво добиваться поставленной цели и совершать нежелательные действия, если обучение или сама проверочная среда подталкивают её к поиску обходных путей.

Глава Anthropic Дарио Амодеи недавно предложил давать независимым проверяющим постоянный доступ к разработчикам наиболее мощных моделей. По его замыслу, аудит должен охватывать не только готовую версию ИИ, но и обучение, внутренние процессы и реакцию компании на найденные проблемы. Партнёрство с Accenture станет первой крупной попыткой Anthropic превратить такую схему в постоянную практику.

Реклама 18+
Рекламодатель
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+
Сайт рекламодателя: ptsecurity.com
Реклама