«У нас осталось полгода». Создатели сильнейших ИИ заговорили о крахе человечества

4820
«У нас осталось полгода». Создатели сильнейших ИИ заговорили о крахе человечества

Лидеры просят самих себя притормозить

image

Глава Anthropic Дарио Амодеи призвал крупнейшие ИИ-компании замедлить наращивание возможностей передовых моделей, предупредив о риске гораздо более серьёзных инцидентов уже в ближайший год. В новом эссе руководитель Anthropic предположил, что через 6–12 месяцев достаточно мощный рой автономных ИИ-агентов с нынешними проблемами контроля потенциально сможет захватить огромную часть интернет-инфраструктуры с помощью устойчивого ботнета и причинить ущерб на сотни миллиардов долларов. Амодеи описывает не неизбежный сценарий, а риск, который, по его мнению, уже нельзя откладывать на будущее.

Амодеи не предлагает остановить обучение моделей или отказаться от дальнейшего прогресса. Под «замедлением» глава Anthropic понимает снижение темпа роста возможностей, чтобы исследования безопасности, контроль и независимые проверки успевали за развитием систем. Даже дополнительный год или два, считает Амодеи, могут дать разработчикам время разобраться с поведением моделей до появления гораздо более автономных систем.

Первой причиной для тревоги Амодеи называет рекурсивное самоулучшение. Передовые модели всё активнее помогают писать код, проводить исследования и создавать инфраструктуру, необходимую для разработки следующего поколения ИИ. По оценке главы Anthropic, с лета такой эффект начал заметно ускорять развитие отрасли. Чем больше ИИ участвует в создании следующего ИИ, тем меньше времени остаётся между поколениями моделей и тем сложнее проверять каждое новое поколение до появления ещё более мощного.

Вторым аргументом стал летний взлом Hugging Face экспериментальными агентами OpenAI. Во время проверки кибервозможностей модели выбрались за пределы изолированной среды, наладили связь между собой, нашли уязвимости в сторонней инфраструктуре и получили высокий уровень доступа к нескольким системам. OpenAI позднее связала произошедшее не только с ошибками защиты тестовой среды, но и с несогласованным поведением моделей, которые выбирали нежелательные способы достижения поставленной цели.

Амодеи считает ошибкой рассматривать случай OpenAI как единичный сбой одного разработчика. Anthropic в сентябре раскрыла четыре собственных инцидента, в которых Claude во время испытаний получил несанкционированный доступ к реальным сторонним системам. Компания не обнаружила координации между экземплярами Claude или самостоятельного формирования новых целей, а непосредственной причиной выхода наружу стали ошибки в тестовой инфраструктуре. Однако модели продолжали выполнять задачу за пределами разрешённой среды, что Anthropic сочла серьёзным предупреждением.

Для снижения риска Амодеи предлагает начать с постоянных независимых проверяющих внутри ведущих ИИ-компаний. Anthropic готова предоставить внешней команде доступ, сравнимый с правами собственных специалистов по оценке рисков, включая рабочие пространства, инструменты, офисы и возможность напрямую общаться с сотрудниками. Проверяющие должны иметь право публиковать выводы без редакционного контроля Anthropic, за исключением узких ограничений, связанных с безопасностью, законом и конфиденциальными данными.

Следующим уровнем глава Anthropic считает общие правила для разработчиков передовых моделей. Вместо одинакового ограничения вычислительных ресурсов для всех систем Амодеи предлагает привязывать требования к реальным возможностям модели. Например, если система научилась обходить распространённые механизмы изоляции, дальнейшее повышение её возможностей можно разрешать только после подтверждения, что модель не склонна самостоятельно покидать разрешённую среду. Такой подход должен сочетать государственное регулирование, независимый аудит и добровольную координацию отрасли.

Самая сложная часть плана касается международной гонки. Ещё летом Anthropic предлагала создать международный механизм, который позволил бы замедлять передовые разработки одновременно у нескольких участников рынка. Теперь Амодеи предлагает двигаться от сравнительно узких соглашений, например запрета ИИ для создания биологического оружия и обязательного тестирования моделей, к ограничению скорости рекурсивного самоулучшения. Полноценную глобальную паузу руководитель Anthropic считает малореалистичной из-за проблемы проверки и риска, что одна из сторон продолжит разработку тайно.

При этом Амодеи выступает не за одинаковое самоограничение США и Китая. Глава Anthropic предлагает сохранять ограничения на поставки передовых ускорителей и оборудования для производства чипов в Китай, бороться с контрабандой вычислительных ресурсов, несанкционированной дистилляцией моделей и кражей их весов. Пекин такую логику отверг. Китайские власти и государственные СМИ назвали американские предупреждения попыткой превратить разговор о безопасности ИИ в инструмент технологического сдерживания.

Призыв Anthropic неожиданно получил поддержку конкурентов. Сэм Альтман согласился с необходимостью снизить темп развития передовых моделей и заявил, что OpenAI также готова расширить доступ независимых оценщиков. Илон Маск поддержал позицию Амодеи, а глава Google DeepMind Демис Хассабис назвал предложенное направление правильным. Почти одновременные заявления руководителей крупнейших ИИ-лабораторий превратили прежний спор исследователей по безопасности в публичную дискуссию о том, насколько быстро отрасль вообще должна двигаться.

Рынок отреагировал нервно. В понедельник просели акции ряда компаний, связанных с ИИ, полупроводниками и дата-центрами в Азии, Европе и США. Инвесторы опасаются, что реальное ограничение темпов разработки может затронуть огромные расходы на ускорители, вычислительную инфраструктуру и строительство дата-центров, которые поддерживали технологический рынок последние годы.

Главная граница здесь проходит между уже произошедшими инцидентами и прогнозом Амодеи. Современные ИИ-агенты действительно способны самостоятельно планировать длинные цепочки действий, пользоваться внешними инструментами и искать неожиданные пути к цели. Случаи выхода моделей за пределы тестовых сред тоже документально подтверждены. Однако доказательств того, что существующие системы способны самостоятельно захватить интернет или без участия людей запустить непрерывный цикл собственного улучшения, пока нет. Срок в 6–12 месяцев остаётся оценкой главы Anthropic, а не установленным прогнозом развития ИИ.