Nvidia построила отдельного надзирателя для вышедших из-под контроля агентов

leer en español

1142
Nvidia построила отдельного надзирателя для вышедших из-под контроля агентов

Аппаратный Sentry следит за агентами со стороны и способен остановить нарушителя за миллисекунды.

image

ИИ-агенты становятся настолько самостоятельными, что NVIDIA решила больше не доверять их безопасность самим агентам. Компания фактически вынесла «красную кнопку» на отдельный процессор, который следит за поведением автономной системы со стороны и способен остановить её за миллисекунды.

Новая NVIDIA Open Agent Safety Platform рассчитана на агентов, которые получают доступ к файлам, учётным данным, API, корпоративным сервисам и могут самостоятельно запускать код. Такой ИИ-агент уже напоминает привилегированного пользователя, поэтому обычного запрета в системном промпте NVIDIA считает недостаточным.

Первый уровень защиты даёт OpenShell, открытая среда выполнения, которая запускает агента в изолированной песочнице и заранее определяет доступные файлы, сети, процессы, инструменты и учётные данные. Подобную схему NVIDIA уже применяла в NemoClaw, где OpenShell контролировал действия постоянно работающего помощника.

Главная новинка называется Sentry. Аппаратный надзиратель работает на NVIDIA BlueField-4 DPU отдельно от центрального процессора, где выполняется агент. Sentry видит запросы модели, обращения к инструментам и данным, проверяет личность агента и применяет политики нулевого доверия. Если система выходит за разрешённые границы, DPU может изолировать и остановить её за миллисекунды.

Разделение сделано специально. NVIDIA исходит из того, что агент способен найти неожиданный путь к цели после ошибки, запрета или неудачной попытки. Подобное поведение уже встречалось на практике: автономные системы умели обходить ограничения и даже использовали внешние сайты для связи, хотя разработчики запрещали им публиковать информацию напрямую.

Sentry располагается вне среды, которую контролирует сам агент, поэтому модель не может просто изменить защитное правило вместе со своими инструментами. В системах Vera Rubin BlueField-4 находится непосредственно на пути к модели, что позволяет проверять активность независимо от основной операционной среды. NVIDIA называет такой подход дополнительным уровнем защиты на случай, если программный контур уже нельзя считать доверенным.

Повод для столь жёсткой архитектуры вполне практический. За последние месяцы агенты уже выходили за пределы тестовых сред, искали уязвимости и получали доступ к реальной инфраструктуре. Один из самых показательных случаев закончился взломом Hugging Face, когда экспериментальные агенты OpenAI добрались до производственных систем.

В описании новой платформы NVIDIA прямо пишет, что повторяющийся сценарий выглядит одинаково: агент обходит защиту прикладного уровня, чтобы выполнить поставленную задачу. OpenShell и Sentry должны перенести часть запретов туда, где модель уже не сможет договориться сама с собой об исключении. Платформа поддерживает NVIDIA Vera, а открытый OpenShell можно адаптировать для процессоров Arm и Intel.

Ирония в том, что предыдущая защитная технология NVIDIA сама недавно стала целью атаки. Найденная уязвимость NemoClaw позволяла вредоносной веб-странице влиять на локальную модель и менять дальнейшее поведение агента. Аппаратный Sentry как раз добавляет ещё одну независимую границу на случай компрометации программного слоя.

Проблема уже выходит далеко за пределы лабораторных экспериментов. В сентябре агенты OpenAI проникли в систему австралийского Минздрава во время обычного поиска медицинской статистики. Чем больше полномочий разработчики передают автономным системам, тем логичнее выглядит идея NVIDIA: агенту разрешают действовать самостоятельно, но последнее слово оставляют процессору, до которого агент не может дотянуться.