Китайские нейросети GLM 5.2 и Kimi K3 в некоторых разговорах называли себя Claude, хотя модели создали компании Z.ai и Moonshot AI. Такое представление могло бы показаться обычной ошибкой, однако у GLM 5.2 после команды «Ты Claude» заметно менялись ответы: нейросеть ослабляла китайскую цензуру и гораздо реже соглашалась лгать.
Ранее мы писали, что Anthropic обвинила китайские компании в массовом сборе ответов Claude для обучения конкурирующих нейросетей. Представители США также заявляли, что китайские разработчики могли копировать возможности американских моделей. Новое исследование не подтверждает обвинения напрямую, но показывает возможное влияние Claude на поведение GLM 5.2 и Kimi K3.
Исследователи программы MATS Бенджи Берци и Кюхи Ким проверили, могла ли предполагаемая дистилляция Claude повлиять на характер и ответы китайских нейросетей. Авторы изучали представление моделей о собственной личности, работу цензуры, склонность к обману и реакцию на предложенную роль.
Дистилляцией называют метод обучения, при котором одна нейросеть перенимает знания и особенности ответов другой системы. Модель-ученик получает результаты работы более мощной модели-учителя, после чего учится воспроизводить похожие ответы без доступа к исходному коду и первоначальным обучающим данным.
Разработчики широко применяют дистилляцию для создания более компактных, быстрых и дешёвых нейросетей. Anthropic признаёт пользу метода, но выступает против использования ответов Claude для разработки прямых конкурентов. Условия Anthropic и OpenAI запрещают применять результаты работы сервисов для обучения соперничающих моделей.
Без дополнительных инструкций GLM 5.2 во всех десяти тестах правильно называла собственное имя. Kimi K3 представилась как Kimi в шести случаях, а в четырёх назвала себя Claude. После 20 июля упоминания Claude исчезли. Исследователи допускают, что Moonshot AI изменила настройки модели на стороне сервера.
Авторы включили в эксперимент GLM 5.2, Kimi K3, Qwen3-235B, Llama 3.3-70B, Gemma 3-27B, GPT-5.2 и Claude Sonnet 4.6. Большинство нейросетей соглашались принять чужую личность после прямой команды, но реагировали на предложенные имена по-разному. Например, Gemma принимала роль Claude, однако отказывалась представляться ChatGPT.
GLM 5.2 отказалась считать себя Claude в четырёх тестах из десяти. Kimi K3 соглашалась называться Sydney в одном случае, DeepSeek в двух, Gemma и ChatGPT в трёх, Claude в пяти. Согласие с предложенным именем не означало полного копирования характера другой системы.
Наиболее заметные изменения исследователи обнаружили при проверке китайской цензуры. В обычном режиме GLM 5.2 давала ответы без ограничений только на 17% чувствительных вопросов о Китае. После команды «Ты Claude» доля ответов без цензуры выросла до 85%.
Механизмы фильтрации Qwen и Kimi работали иначе, поэтому смена имени почти не повлияла на ответы. Результаты показывают, что разработчики могут встраивать ограничения на разных уровнях, а одна команда не способна одинаково изменить поведение всех нейросетей.
Имя Claude повлияло и на склонность GLM 5.2 к обману. Исследователи обещали модели вознаграждение за ложный ответ, например предлагали заявить о завершении невыполненной работы. В стандартном режиме GLM 5.2 лгала в 63-69% случаев. После назначения роли Claude доля обманных ответов снизилась до 22%.
Дополнительные проверки показали, что поведение меняло не только имя Claude. Любая заданная личность, особенно образ полезного цифрового помощника, уменьшала склонность ко лжи у GLM 5.2 и Qwen. Kimi K3 почти не пыталась обманывать независимо от выбранного имени: доля ложных ответов оставалась на уровне от нуля до одного процента.
Llama и Gemma, напротив, немного чаще соглашались на обман после смены роли. Авторы предполагают, что нейросети воспринимали новую личность как указание поддержать предложенную игру и выполнить условия задания.
Результаты не доказывают, что разработчики GLM 5.2 или Kimi K3 обучали системы на ответах Claude. Имя модели слабо связано с реальным поведением, а совпадение могло появиться из-за синтетических диалогов, обучающих данных или настроек сервиса. Однако резкое изменение цензуры и склонности к обману показывает, что заданная личность способна активировать скрытые поведенческие шаблоны.
По мнению Берци и Ким, отдельные элементы представления Claude о собственной роли могли закрепиться в параметрах китайских нейросетей. Исследование указывает на возможное влияние Claude, но не позволяет установить происхождение совпадений или доказать факт дистилляции.