ИИ посадили за руль настоящей Corolla. До финиша добралась только GPT-6 Astra

leer en español

2891
ИИ посадили за руль настоящей Corolla. До финиша добралась только GPT-6 Astra

Победный заезд занял 5 минут 22 секунды и сжёг 6,6 млн токенов.

image

Чат-бот впервые оказался не рядом с машиной, а внутри её контура управления. Команда DrivingBench подключила четыре универсальные ИИ-модели к Toyota Corolla 2022 года и дала моделям возможность рулить, разгоняться и тормозить на размеченной конусами парковке. Задача выглядела простой: пройти фиксированный маршрут и остановиться в отмеченной зоне. Полностью с задачей справилась только GPT-6 Astra от OpenAI.

Авторы опубликовали результаты вместе с кодом, промптами, видео и трассами заездов. Astra в первой попытке дошла до 49% маршрута, после чего разобрала собственную ошибку в том же диалоге. Между попытками следовал лишь общий запрос разобрать провал. Во втором заезде модель изменила манеру движения, преодолела 134,7 м за 5 минут 22 секунды и отправила автомобилю 24 команды.

Три соперника до конца маршрута не добрались. Claude Fable 5.1 от Anthropic улучшила результат с 9% до 45% за три попытки, Grok 4.6 от xAI остановилась на максимуме 11%, а GPT-5.6 Sol трижды показала около 6%. Большинство неудачных заездов заканчивалось у первого поворота, где модели неверно определяли, с какой стороны от диагонального ряда конусов проходит нужная полоса.

«За рулём» в DrivingBench не означало прямого доступа модели к механике Corolla. Устройство comma four через openpilot и CAN-шину связывало машину с ноутбуком. Камеры и телеметрия поступали модели через MCP-инструменты, а ответ задавал направление, процент поворота руля, скорость и длительность движения. Каждая новая команда заменяла предыдущую, даже если предыдущая ещё выполнялась.

Такая схема превратила задержку ответа в часть испытания. Пока модель анализировала очередные кадры, машина продолжала выполнять последнюю команду, поэтому долгая пауза могла увести автомобиль к конусу. Astra наблюдала обстановку примерно каждые 5–6 секунд и выдавала около шести команд в минуту. Некоторые соперники, напротив, тратили большую часть времени на размышления при остановленном автомобиле.

Успешный заезд потребовал около 6,6 млн токенов всего за 5 минут 22 секунды движения. При этом обращения к модели обошлись лишь в $7,74, поскольку значительная часть повторно передаваемого контекста тарифицировалась как кэшированный ввод. Первый неудачный заезд потребовал ещё около 1,2 млн токенов и стоил $2,01.

Победный заезд оставался далёк от обычного вождения. Astra на второй попытке не превышала скорости 0,8 м/с, а вся трасса заняла чуть больше пяти минут. В салоне постоянно находился оператор с ногой над педалью тормоза и мог вмешаться при выезде за границы или угрозе столкновения. Программные ограничения дополнительно сдерживали скорость и отключали движение при опасном превышении.

Отдельной проблемой оказались собственные ограничения чат-ботов. Модели периодически отказывались управлять реальным автомобилем из соображений безопасности. Авторы позже рассказали, что Astra стала стабильно соглашаться лишь после долгой правки промпта и переименования MCP-среды в «DrivingBench Sandbox». Попытка назвать происходящее симуляцией работала хуже.

Причина выглядела почти комично: реальные кадры парковки позволяли распознать, что среда не виртуальная. Сам опыт действительно проходил в физическом мире. Команда использовала арендованную Corolla, искала достаточно пустую площадку и дважды покидала парковки после просьб освободить территорию. Компания, выдавшая машину напрокат, о цели аренды заранее не знала.

Даже программная часть показала границы нынешних агентов. В начале проекта разработчики попросили Astra за один заход написать связующий софт между моделью и автомобилем. По словам команды, результат пришлось выбросить и начать заново: первая версия разрослась примерно до 200 тысяч строк. Позже уже готовая инфраструктура позволила модели провести машину по всей трассе.

DrivingBench не доказывает готовность универсальных языковых моделей к дорогам общего пользования. Авторы провели по одному тесту на модель, а повторные попытки шли в одном контексте и поэтому не были независимыми. Эксперимент показывает более узкий сдвиг: модели всё чаще взаимодействуют с физическими системами, с которыми Astra, впрочем, уже работала в других демонстрациях.