Две топовые ИИ-модели отправили управлять парком развлечений, а затем выдали базуки и заставили воевать в Worms Armageddon. GPT-6 Astra сумела выполнить экономическую задачу в RollerCoaster Tycoon 2, тогда как Fable 5.1 провалила цель и сожгла примерно в пять раз больше токенов. Зато на поле боя результат перевернулся, и Fable дважды обыграла соперницу.
Эксперимент устроил Питер Гостев, руководитель направления AI Capability в Arena. Смысл проверки был не в игровом мастерстве как таковом. RollerCoaster Tycoon 2 заставляет агента часами удерживать состояние сложной системы, планировать инфраструктуру, следить за экономикой, замечать собственные ошибки и исправлять последствия неудачных решений.
Первой задачей стали тысяча посетителей и максимально прибыльный парк. Обе модели работали на среднем уровне рассуждений в собственных агентских средах. Astra добралась до тысячи посетителей примерно за три часа и закончила эксперимент со стоимостью парка около $65 тысяч. Fable за три с половиной часа до цели не дошла, а стоимость её парка составляла примерно $18 тысяч.
Разница оказалась заметна и по расходам. Astra использовала около 50 млн токенов, Fable около 250 млн. По расчёту Гостева на основе API-тарифов такой прогон стоил бы примерно $68 для Astra и $297 для Fable.
Astra действовала агрессивнее с коммерческой точки зрения. Модель строила крупные американские горки, проверяла выручку, меняла цены, гасила долги и потратила около $50 тысяч внутриигровых денег на рекламу. Продуманным менеджером назвать Astra всё же трудно. В какой-то момент очередь к карусели перекрыла выход с горок, а магазин картошки появился в месте, куда посетители практически не могли добраться.
Любопытнее сама реакция на ошибки. Astra заметила, что закусочная ничего не продаёт, и в конце концов перенесла магазин. Для автономного агента способность обнаружить плохое последствие собственного решения и перестроить план может быть ценнее безошибочного первого хода.
Fable выбрала другую стратегию. После удачной первой горки модель решила масштабировать успех буквально и заполнила парк повторяющимися аттракционами. Появились четыре одинаковых Twist, четыре слайда и три колеса обозрения. Поток посетителей почти не вырос. Примерно через час в парке находились лишь 77 человек из требуемой тысячи.
Затем начались проблемы с дорожками, доступом механиков и поломками. Некоторые входы оказывались заблокированы, но Fable продолжала занимать деньги и расширять парк даже при операционных убытках. Ближе к концу модель частично восстановила ситуацию, однако слишком медленно, чтобы выполнить поставленную задачу.
Во второй части эксперимента экономику убрали, а моделям доверили Worms Armageddon. Здесь от агента требуются уже другие способности. Нужно оценивать рельеф, угол и силу выстрела, приблизительно учитывать физику и ветер, выбирать оружие, сравнивать риск и строить план на несколько ходов вперёд. Причём один неудачный выстрел способен мгновенно изменить карту.
Первая серия закончилась разгромом Astra со счётом 0:3. Гостев оценил игру обеих моделей как довольно слабую, но Astra особенно часто принимала решения, которые фактически вредили собственной команде. Сам исследователь описал происходящее как смесь осмысленного поведения и «полного идиотизма».
Гостев повторил дуэль на максимальном уровне рассуждений. Матчи стали заметно плотнее, перед последней партией счёт дошёл до 2:2, но Fable снова победила и закончила серию со счётом 3:2. Повышение вычислительных затрат при этом не избавило обе модели от большого числа очевидных ошибок.
Подобные игровые испытания постепенно превращаются в удобный тест для ИИ-агентов. Ранее Astra уже прошла Portal и добыла алмаз в Minecraft, где тоже требовалось долго выполнять последовательность действий и восстанавливаться после неудач. В отличие от коротких академических тестов, игра заставляет модель жить с последствиями собственных решений десятки минут или часы.
Результаты Гостева нельзя считать полноценным сравнительным бенчмарком. Выбор игр невелик, число прогонов ограничено, а итог зависит от агентской оболочки, доступных инструментов и настроек рассуждений. Но эксперимент хорошо показывает разницу между способностью модели рассуждать в отдельном ответе и умением часами управлять меняющимся миром, где вчерашняя ошибка продолжает мешать через сотню действий.
На фоне разговоров о том, что сверхмощный ИИ однажды может уничтожить человечество, результаты пока выглядят несколько успокаивающе. С уничтожением чужих червячков передовые модели справляются заметно хуже, чем хотелось бы будущему машинному властелину.