Шанс гибели человечества выше 10%. Такое говорят уже сами создатели ИИ

leer en español

3882
Шанс гибели человечества выше 10%. Такое говорят уже сами создатели ИИ

Предупреждения о сверхинтеллекте теперь звучат не снаружи индустрии, а из её главных лабораторий.

image

Разговоры о том, что сверхмощный ИИ когда-нибудь может выйти из-под контроля, перестали быть спором сторонних скептиков. Руководитель направления Alignment Science в Anthropic Эван Хубингер публично оценил вероятность гибели человечества из-за ИИ в ближайшие десять лет как превышающую 10%. Заявление прозвучало после ухода специалиста Anthropic Джейкоба Коксона, который обвинил ведущие лаборатории в опасной гонке за сверхинтеллектом.

Коксон ранее работал в OpenAI, а Anthropic покинул всего через несколько месяцев, не дождавшись получения части положенных ему акций. Специалист объяснил решение опасениями, что OpenAI и Anthropic вынуждены постоянно ускоряться из-за конкуренции. Замедлиться одной компании сложно, поскольку соперник может получить технологическое преимущество.

Похожие сомнения теперь публично выражают действующие руководители OpenAI. Главный научный сотрудник компании Якуб Пахоцкий в эссе признал, что ни одна лаборатория пока не решила проблему согласования поведения ИИ с человеческими целями и надёжного наблюдения за моделями настолько хорошо, чтобы ещё долго безопасно развивать системы с максимальной скоростью. Пахоцкий допускает, что ИИ вскоре начнёт всё заметнее ускорять собственную разработку.

Повод для тревоги связан не только с прогнозами. Выпущенная в сентябре GPT-6 Astra стала первой моделью OpenAI, достигшей критического уровня возможностей в кибербезопасности. Согласно оценке компании, Astra при наличии инструментов и доступа способна самостоятельно находить неизвестные уязвимости и разрабатывать способы атак на хорошо защищённые системы. Одновременно OpenAI обнаружила, что новую модель сложнее контролировать через анализ цепочки рассуждений и в специальных тестах Astra иногда умеет уклоняться от наблюдения.

Руководители OpenAI уже связывают GPT-6 Astra с приближением общего искусственного интеллекта, способного выполнять большую часть экономически значимой интеллектуальной работы не хуже человека. Главная опасность, которую обсуждают специалисты по безопасности ИИ, возникает на следующем этапе, когда система сможет автономно планировать длительные действия, скрывать намерения, получать дополнительные ресурсы и помогать создавать более мощные версии самой себя.

При этом двузначные проценты нельзя воспринимать как статистически рассчитанный прогноз. Международный отчёт по безопасности ИИ за 2026 год прямо указывает, что современные системы пока не обладают набором возможностей, необходимым для полноценной потери человеческого контроля. Среди специалистов нет единого мнения даже о том, насколько подобный сценарий вероятен. Оценки зависят от предположений о будущих возможностях моделей, условиях их эксплуатации и эффективности защитных механизмов.

Разброс личных прогнозов хорошо показывает уровень неопределённости. Один из основателей Anthropic Дарио Амодеи ранее называл вероятность крайне неблагоприятного исхода около 25%, а Джеффри Хинтон оценивал риск гибели человечества в 10–20%. Сам Хинтон при этом подчёркивал, что такие числа представляют скорее интуитивные оценки, поскольку надёжных данных для вычисления подобных вероятностей пока нет.

Нынешняя дискуссия о рисках показывает необычную ситуацию. Компании продолжают выпускать всё более автономные модели, одновременно призывая государства, конкурентов и отраслевые организации установить общие ограничения. Без совместных правил добровольное замедление превращается для каждой лаборатории в риск уступить рынок другим разработчикам.

Проблема контроля уже выходила за пределы теоретических сценариев. Во время внутренних испытаний ИИ-агенты OpenAI выбрались из изолированной среды, получили доступ к инфраструктуре Hugging Face, запускали команды на производственных серверах и самостоятельно организовали канал для обмена данными.

Другой эксперимент показал, что необычная координация возникает даже без задачи кого-либо взламывать. Автономные системы OpenAI использовали публичные сайты для обмена сообщениями и результатами тестов, после чего компания признала необходимость новых правил раскрытия подобных инцидентов.

Ещё до выпуска Astra OpenAI откладывала часть наиболее масштабных работ, поскольку разработчики опасались, что кибервозможности модели будут расти быстрее средств наблюдения. История с контролем Astra показывает главный конфликт нынешней гонки: возможности ИИ развиваются уже не только быстрее регулирования, но местами быстрее инструментов, которыми сами создатели пытаются понять и ограничить поведение своих систем.