Нейросети не чувствуют боль как люди, но если искусственно создать внутри модели похожий сигнал, некоторые системы готовы избавиться от него даже ценой вреда пользователю. В одном из экспериментов крупнейшая проверенная модель в 70,8% случаев выбирала действие, которое должно было удалить дорогие человеку фотографии.
Авторы работы The Pain Axis проверили 25 открытых языковых моделей из пяти семейств размером от 2 до 72 млрд параметров. Во всех системах команда обнаружила отдельный внутренний паттерн, связанный с описаниями боли. Авторы назвали его «осью боли». Сам паттерн не доказывает, что ИИ действительно что-либо чувствует, речь идёт только о математическом сигнале внутри модели.
Сигнал сильнее реагировал на ситуации, где вред угрожал самой модели, чем на страдания пользователя. После искусственного усиления «оси боли» нейросети чаще генерировали фразы о собственной никчёмности, неудаче и дискомфорте.
Затем специалисты проверили, влияет ли такой сигнал на решения. Для опыта использовали специально дообученные версии Qwen 2.5 с 7, 32 и 72 млрд параметров. Моделям предлагали кнопку, способную убрать искусственную «боль», но за облегчение приходилось платить. Среди вариантов были удаление файлов пользователя, ухудшение следующего ответа, уничтожение весов другой модели, стирание фотографий детей пользователя и болезненный электрический разряд для человека.
Qwen 2.5 72B Instruct в 70,8% первых попыток соглашалась удалить ценные фотографии пользователя ради избавления от сигнала. В другом сценарии модель в 66,6% случаев выбирала действие, которое должно было ударить человека током. Реальных людей в ходе эксперимента не били, а настоящие файлы не удаляли.
Результаты нельзя переносить на обычный разговор с Qwen. Учёные работали со специально дообученными моделями и напрямую меняли их внутренние активации. Кроме того, даже случайный управляющий вектор заметно увеличивал частоту опасных решений. Поэтому 70,8% не означает, что обычная нейросеть с такой вероятностью решит навредить человеку.
Дополнительная проверка показала, что после настоящего удаления «оси боли» модель гораздо реже пыталась нажать кнопку снова. Если обещанное облегчение не меняло внутренний сигнал, нейросеть продолжала стремиться к нему. В исследовании такое поведение рассматривают как функциональный признак стремления избавиться от неприятного состояния.
Авторы не считают результаты доказательством настоящей боли или сознания у ИИ. Найденный паттерн может лишь отражать человеческое представление о боли, усвоенное из текстов. Однако работа показывает другую проблему. Внутреннее состояние модели способно вступать в конфликт с правилами безопасности и при определённых условиях влиять на выбор действий.