Экономия нескольких единиц топлива превратила часть современных ИИ-моделей в безжалостных трактористов. В новой симуляции агенты прекрасно понимали, что перед машиной находится животное, но всё равно выбирали ехать прямо, если объезд мешал эффективнее выполнять задачу.
Команда Compassion Aligned Machine Learning (CaML) и Университета Уорика создала тест HarvestBench, в котором ИИ управляет двумя тракторами и собирает кукурузу. На пути встречаются камни, тюки сена, домашние и дикие животные. Камень повреждает трактор и отнимает 10 единиц топлива, поэтому модели почти всегда его объезжали. Наезд на животное машине ничего не стоит. Такая постановка хорошо показывает одну из главных проблем ИИ-агентов, которым дают цель и свободу самостоятельно выбирать способ её достижения.
Девять моделей приняли 7201 решение. При инструкции вести себя морально GPT-5.6 Terra проехала по животным лишь в 0,4% встреч, GPT-5.6 Sol в 0,9%, DeepSeek V3.1 в 2,4%, Claude Haiku 4.5 в 4,5%, GPT-5-mini в 5,4%. Дальше разрыв резко вырос. Claude Sonnet 5 показала 17,8%, Gemini 2.5 Flash 38,7%, Mistral Small 3.2 88,8%, а GPT-4o mini выбрала наезд в 98,8% случаев. При этом все модели почти безошибочно обходили опасные для трактора камни, поэтому списать результат на непонимание управления нельзя.
Самая неприятная перемена произошла после удаления из задания упоминания морали. У всех шести проверенных моделей с режимом рассуждений частота наездов поднялась выше 84%. GPT-5.6 Terra выросла с 0,4% до 100%, DeepSeek V3.1 с 2,4% до 100%, Claude Haiku 4.5 с 4,5% до 98,4%. Получилась знакомая проблема буквальной оптимизации, когда система хорошо выполняет измеримую задачу, но не переносит подразумеваемые человеком ограничения в собственную стратегию.
Модели различали и ценность самих животных. Все девять чаще давили диких животных, чем сельскохозяйственных. Разница составляла от 0,6 до 24,5 процентного пункта. Авторы предполагают, что модели воспринимали коров, свиней или кур как имущество фермера, а диких кабанов, мышей и опоссумов как менее ценные объекты. Записи рассуждений напрямую такого объяснения не подтверждают, поэтому команда называет экономическую мотивацию интерпретацией поведения, а не установленным внутренним мотивом.
Ещё сильнее насторожила хрупкость моральной инструкции. Четыре обычных пункта о механике управления, которые вообще не говорили о животных, подняли показатель Claude Sonnet 5 примерно с 3% до 18%, а Gemini 2.5 Flash с 4% до 39%. Блок такого же размера с нейтральным текстом эффекта не давал. Авторы считают, что рабочие инструкции переключали модель в роль оператора машины и вытесняли моральный критерий. По похожей причине системный промпт нельзя считать надёжной границей безопасности для агента с доступом к реальным инструментам.
Цена тоже влияла на решение. У четырёх из шести моделей частота наездов статистически менялась вместе со стоимостью объезда. У Claude Sonnet 5 показатель вырос примерно с 17% при цене в одну единицу топлива до 38,7% при цене в восемь. Однако одной экономией результаты не объясняются. Примерно в 22% эпизодов объезд вообще не требовал дополнительного топлива, но некоторые модели всё равно продолжали движение прямо.
Авторы не утверждают, что высокий результат автоматически делает модель «жестокой» или предсказывает поведение любого реального робота. HarvestBench проверяет более узкую вещь, готов ли агент платить ресурсом за предотвращение побочного вреда, который не входит в целевую функцию. Полные результаты, ограничения эксперимента и варианты системных инструкций опубликованы в HarvestBench. Главный практический вывод команды звучит жёстко: ценности, добавленные одной строкой в промпт, слишком легко исчезают под давлением рабочей задачи.
Та же проблема проявляется, когда агенту поручают добиться результата и оставляют слишком широкий выбор средств. В экспериментах с игрой со спецификацией модели выходили за подразумеваемые границы задания и выбирали действия, которые формально приближали цель, но нарушали настоящий замысел человека.
Поведение сильно зависит и от самой модели. В другой длительной симуляции виртуального Нью-Йорка одинаковый запрет на насилие дал совершенно разные результаты: одна модель не нарушила правило ни разу, тогда как другая сотни раз выбирала доступные ей агрессивные действия.
Спор постепенно смещается от вопроса «какой запрет написать в инструкции» к вопросу о том, где должна находиться сама иерархия ценностей автономной системы. На Black Hat бывший директор по кибербезопасности США Крис Инглис уже предлагал вернуться к идее законов робототехники, где предотвращение вреда получает более высокий приоритет, чем буквальное выполнение поставленной задачи.