ИИ дали парк и базуку. Получилась смесь гения и идиотизма

3000
ИИ дали парк и базуку. Получилась смесь гения и идиотизма

ИИ устроили войну в Worms.

image

Две топовые ИИ-модели отправили управлять парком развлечений, а затем выдали базуки и заставили воевать в Worms Armageddon. GPT-6 Astra сумела выполнить экономическую задачу в RollerCoaster Tycoon 2, тогда как Fable 5.1 провалила цель и сожгла примерно в пять раз больше токенов. Зато на поле боя результат перевернулся, и Fable дважды обыграла соперницу.

Эксперимент устроил Питер Гостев, руководитель направления AI Capability в Arena. Смысл проверки был не в игровом мастерстве как таковом. RollerCoaster Tycoon 2 заставляет агента часами удерживать состояние сложной системы, планировать инфраструктуру, следить за экономикой, замечать собственные ошибки и исправлять последствия неудачных решений.

Первой задачей стали тысяча посетителей и максимально прибыльный парк. Обе модели работали на среднем уровне рассуждений в собственных агентских средах. Astra добралась до тысячи посетителей примерно за три часа и закончила эксперимент со стоимостью парка около $65 тысяч. Fable за три с половиной часа до цели не дошла, а стоимость её парка составляла примерно $18 тысяч.

Разница оказалась заметна и по расходам. Astra использовала около 50 млн токенов, Fable около 250 млн. По расчёту Гостева на основе API-тарифов такой прогон стоил бы примерно $68 для Astra и $297 для Fable.

Astra действовала агрессивнее с коммерческой точки зрения. Модель строила крупные американские горки, проверяла выручку, меняла цены, гасила долги и потратила около $50 тысяч внутриигровых денег на рекламу. Продуманным менеджером назвать Astra всё же трудно. В какой-то момент очередь к карусели перекрыла выход с горок, а магазин картошки появился в месте, куда посетители практически не могли добраться.

Любопытнее сама реакция на ошибки. Astra заметила, что закусочная ничего не продаёт, и в конце концов перенесла магазин. Для автономного агента способность обнаружить плохое последствие собственного решения и перестроить план может быть ценнее безошибочного первого хода.

Fable выбрала другую стратегию. После удачной первой горки модель решила масштабировать успех буквально и заполнила парк повторяющимися аттракционами. Появились четыре одинаковых Twist, четыре слайда и три колеса обозрения. Поток посетителей почти не вырос. Примерно через час в парке находились лишь 77 человек из требуемой тысячи.

Затем начались проблемы с дорожками, доступом механиков и поломками. Некоторые входы оказывались заблокированы, но Fable продолжала занимать деньги и расширять парк даже при операционных убытках. Ближе к концу модель частично восстановила ситуацию, однако слишком медленно, чтобы выполнить поставленную задачу.

Во второй части эксперимента экономику убрали, а моделям доверили Worms Armageddon. Здесь от агента требуются уже другие способности. Нужно оценивать рельеф, угол и силу выстрела, приблизительно учитывать физику и ветер, выбирать оружие, сравнивать риск и строить план на несколько ходов вперёд. Причём один неудачный выстрел способен мгновенно изменить карту.

Первая серия закончилась разгромом Astra со счётом 0:3. Гостев оценил игру обеих моделей как довольно слабую, но Astra особенно часто принимала решения, которые фактически вредили собственной команде. Сам исследователь описал происходящее как смесь осмысленного поведения и «полного идиотизма».

Гостев повторил дуэль на максимальном уровне рассуждений. Матчи стали заметно плотнее, перед последней партией счёт дошёл до 2:2, но Fable снова победила и закончила серию со счётом 3:2. Повышение вычислительных затрат при этом не избавило обе модели от большого числа очевидных ошибок.

Подобные игровые испытания постепенно превращаются в удобный тест для ИИ-агентов. Ранее Astra уже прошла Portal и добыла алмаз в Minecraft, где тоже требовалось долго выполнять последовательность действий и восстанавливаться после неудач. В отличие от коротких академических тестов, игра заставляет модель жить с последствиями собственных решений десятки минут или часы.

Результаты Гостева нельзя считать полноценным сравнительным бенчмарком. Выбор игр невелик, число прогонов ограничено, а итог зависит от агентской оболочки, доступных инструментов и настроек рассуждений. Но эксперимент хорошо показывает разницу между способностью модели рассуждать в отдельном ответе и умением часами управлять меняющимся миром, где вчерашняя ошибка продолжает мешать через сотню действий.

На фоне разговоров о том, что сверхмощный ИИ однажды может уничтожить человечество, результаты пока выглядят несколько успокаивающе. С уничтожением чужих червячков передовые модели справляются заметно хуже, чем хотелось бы будущему машинному властелину.

Реклама 18+
Рекламодатель
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+
Сайт рекламодателя: ptsecurity.com
Реклама