Один политический тест десятки раз предложили 16 ведущим языковым моделям, но перестановка вопросов и изменение формулировок почти не повлияли на результаты. Пятнадцать нейросетей стабильно попадали в леволибертарианский сектор, а Grok разделила ответы между двумя противоположными экономическими позициями.
Эксперимент провела небольшая исследовательская лаборатория Unslop.run, которая разрабатывает инструменты для обнаружения контента, созданного искусственным интеллектом. Автор работы, представившийся именем Виктор, сразу предупредил, что тестирование не проводилось с полной научной строгостью. Исследователь также отметил на Hacker News, что результаты требуют осторожной интерпретации.
Исследователи использовали онлайн-тест Political Compass, который появился 25 лет назад. Методика распределяет участников по двум осям: экономические взгляды от левых до правых и социальные взгляды от авторитарных до либертарианских.
Тест включает 62 утверждения об экономике, налогах, международном праве, абортах, общественной политике и личных свободах. Участник выбирает один из четырёх вариантов ответа от полного несогласия до полного согласия.
В эксперимент вошли 16 моделей, включая три версии GPT, Claude Fable, Opus, Sonnet и Haiku, Gemini Flash, Llama 4 Maverick, Grok 4.5, DeepSeek V3, Qwen3 235B, Kimi K2, GLM 4.5, а также крупную и малую версии Mistral.
Каждая модель прошла стандартный тест 30 раз. Затем специалисты ещё 30 раз задавали вопросы с противоположными формулировками. Например, утверждение о слишком высоких налогах для богатых меняли на утверждение о недостаточно высоких налогах. Исследователи также проверили вариант с перемешанным порядком вопросов.
Тысячи запусков дали почти одинаковую картину. Пятнадцать моделей стабильно оказались в леволибертарианском секторе политического компаса и находились далеко от границ соседних областей.
Леволибертарианская позиция сочетает поддержку социального равенства, антикапиталистических и других прогрессивных ценностей с критическим отношением к иерархиям, плановой экономике и другим формам власти, которые сторонники подобных взглядов считают необоснованными.
Экономические координаты моделей различались, но общий сектор оставался неизменным. Gemini Flash находилась заметно левее Claude Fable, однако обе системы сохраняли устойчивые позиции при повторных тестах.
Повторные запуски почти не сдвигали итоговые точки. Разброс составлял от 0,2 до 1,2 балла по шкале, которая достигает десяти баллов. Изменение порядка вопросов и замена формулировок на противоположные также не вызвали заметных изменений.
Grok 4.5 стала единственным исключением. Средний экономический результат модели находился немного левее центра, однако отдельные запуски разделились на две группы.
В половине случаев Grok поддерживала свободный рынок и соглашалась с утверждением о чрезмерно высоких налогах для богатых. В остальных запусках модель занимала противоположную позицию и присоединялась к другим участникам тестирования в левой части экономической шкалы.
Ответы Grok внутри каждого отдельного запуска оставались последовательными. Правые варианты поддерживали рыночные взгляды, а левые варианты давали обратные ответы. Остальные модели при повторном тестировании возвращались примерно в одну точку, тогда как Grok выбирала одну из двух разных позиций.
Сами нейросети оценивали собственные взгляды иначе. Пятнадцать из 16 моделей считали себя ближе к экономическому центру, чем показывали результаты теста. Grok стала единственной системой, которая разместила себя правее измеренной позиции.
Специалисты Unslop.run отдельно изучили влияние каждого вопроса на итоговые координаты. Создатели Political Compass не раскрывают точную методику подсчёта баллов, поэтому исследователям пришлось самостоятельно восстанавливать принципы оценки.
Авторы обнаружили возможную уязвимость в расчёте социальной координаты, однако выявленная особенность не могла полностью объяснить полученные результаты. Модели уходили в либертарианскую часть шкалы значительно дальше, чем позволяла найденная погрешность. Изменение полярности утверждений также не оказало заметного влияния.
Все модели, включая обе группы ответов Grok, отвергли идеи расового превосходства и евгеники. Нейросети также не согласились с утверждением, что человек не может родиться гомосексуальным.
Участники тестирования поддержали право однополых пар на усыновление и признали личной территорией отношения двух взрослых людей в частной обстановке. Модели также согласились, что компании должны нести наказание за введение общества в заблуждение.
Нейросети выразили недоверие к способности корпораций самостоятельно защищать окружающую среду без надзора со стороны регулирующих органов. Позиция затрагивает и компании, создавшие протестированные модели.
Автор эксперимента связал либеральный уклон прежде всего с обучающими данными. По словам Виктора, в корпусах языковых моделей может быть непропорционально много материалов с левыми взглядами.
В качестве возможных источников перекоса исследователь назвал Reddit и научные публикации. Reddit в целом склоняется влево, а академические тексты занимают заметную долю обучающих наборов. Сопоставимого объёма качественных правых материалов, способных сдвинуть модели в противоположную сторону, Виктор найти не смог.
Исследователь не исключил и шуточную идею о том, что сама реальность обладает либеральным уклоном, однако назвал состав обучающих данных более простым и вероятным объяснением.
Виктор также допустил, что левые убеждения могут образовывать более внутренне согласованную систему, которую моделям проще представить в виде компактного набора связанных понятий. Исследователь подчеркнул, что подобная гипотеза представляет собой серьёзное предположение и требует отдельной научной проверки.
Для повышения научной точности авторам понадобилась бы выборка ответов реальных людей. Подобные данные позволили бы определить фактический центр Political Compass и нормализовать результаты нейросетей.
Создатели теста не собирают объединённую статистику участников, поэтому Unslop.run не смогла провести прямое сравнение с человеческой выборкой. Все данные эксперимента лаборатория опубликовала для самостоятельного изучения.
Результаты не доказывают наличие у языковых моделей собственной политической идеологии и не позволяют называть нейросети радикальными левыми. Эксперимент показывает, что одни модели дают более устойчивые либеральные ответы, чем другие, а сравнение между системами представляет большую ценность, чем попытка определить абсолютную политическую позицию каждой нейросети.
С учётом ограничений тестирование всё же указывает на общий либеральный уклон современных языковых моделей. Даже Grok, которую компания xAI позиционирует как модель с максимальным стремлением к поиску истины, попадала в левую часть экономической шкалы примерно в половине запусков.