DeepMind хочет создать один «мозг», который можно пересаживать между роботами

leer en español

4401
DeepMind хочет создать один «мозг», который можно пересаживать между роботами

Машинам больше не придётся учиться жизни с нуля.

image

Идея универсального «мозга» для роботов перестала быть только исследовательской целью. Google DeepMind пытается создать интеллект, который сохраняет навыки при переходе между разными корпусами, руками и приводами. В Gemini Robotics 2 компания уже использует один и тот же контрольный слепок модели на нескольких роботах, а локальную версию адаптирует к новому телу за несколько часов.

Google DeepMind показала Gemini Robotics 2 в конце июля. Система управляет всем телом гуманоида Apptronik Apollo 2, включая ноги, корпус, руки и пальцы, а тот же слепок модели работает на двух конфигурациях Apollo и двухрукой платформе Franka Duo. В одном случае меняются даже кисти: SharpaWave заменяет Inspire. Главная ставка сделана на перенос навыков между разной механикой.

Под «мозгом» скрывается не одна нейросеть, которую можно буквально переставить без настройки. Gemini Robotics 2 преобразует изображение и текстовую команду в движения, Gemini Robotics ER 2 планирует многошаговую работу и следит за её ходом, а Gemini Robotics On-Device 2 выполняет управление локально. Последнюю модель DeepMind учит быстро приспосабливаться к новому корпусу.

Для новой двухрукой платформы Gemini Robotics On-Device 2 обычно хватает менее 200 примеров и нескольких часов дополнительного обучения. DeepMind проверила такой перенос на Dexmate, SO101 и Trossen, которые различаются формой, датчиками и числом степеней свободы. Такой подход сокращает объём данных, который раньше приходилось отдельно собирать для каждой конструкции.

Перенос между корпусами не означает человеческую ловкость. В тестах Apollo 2 с многопалой кистью отвинчивал лампочку в 92% попыток, но завинчивал её только в 36%, а работа совком удавалась в 32% случаев. С обычным двухпальцевым захватом Franka Duo справлялась лучше: точная вставка деталей достигла 89,6%, а комплектование инструментов 78,9%. Даже соседние навыки расходятся резко.

Похожий разрыв заметен и в движениях всего тела. Apollo 2 успешно забирал предмет с полки в 76,3% испытаний, со стола в 68,4%, а с пола только в 45,7%. DeepMind прямо признаёт, что скорость движений и многопалая манипуляция остаются слабым местом. Поэтому нынешние результаты описывают лабораторные демонстрации, а не готового универсального помощника.

Scientific American разобрал ещё одно ограничение подхода. Современные модели получают огромный объём зрительных данных, но почти не имеют сопоставимого массива данных о прикосновении, силе и положении суставов. Робот может видеть виноград или бокал и выбирать движение, однако хуже человека чувствует момент, когда предмет начинает скользить, сгибаться или разрушаться.

Высокоуровневую часть DeepMind строит вокруг «воплощённого рассуждения», когда ИИ оценивает обстановку, разбивает задачу на этапы и меняет план после ошибки. В апреле Google уже расширила такие возможности в Gemini Robotics-ER 1.6, добавив лучшее пространственное понимание, работу с несколькими камерами и проверку результата. Новая версия развивает тот же принцип для более длинных сценариев.

Gemini Robotics ER 2 теперь ведёт последовательности длиной в несколько минут и сотни решений, отслеживает начало и завершение этапов и может координировать несколько разных роботов. Для работы рядом с людьми DeepMind добавила проверки безопасности, включая остановку при слишком близком приближении человека и отказ от опасных действий. Пока такие функции проверяются в контролируемых условиях.

На 16 сентября доступность остаётся ограниченной. Gemini Robotics ER 2 можно тестировать через Google AI Studio, а доступ через Gemini Enterprise Agent Platform находится в закрытом предварительном режиме. Основная VLA-модель и On-Device 2 выдаются партнёрам раннего доступа. Цель DeepMind шире конкретного гуманоида: отделить интеллект робота от корпуса и сделать навыки переносимыми между машинами.

Реклама 18+
Рекламодатель
Реклама. АО «Позитив Текнолоджиз». ИНН 7718668887. 18+
Сайт рекламодателя: ptsecurity.com
Реклама