После выхода ChatGPT англоязычный интернет начал заметно писать как чат-бот. Исследователи проанализировали 490 тысяч страниц, собранных с января 2021 по июль 2026 года, и увидели резкий рост характерных для генеративного ИИ слов, конструкций и знаков препинания. К июлю 2026 года значимые признаки машинного авторства или редактирования находились примерно на каждой десятой странице, а среди материалов, опубликованных после запуска ChatGPT, уже более чем на трети.
Самый наглядный след оставило длинное тире. В начале 2023 года исследователи насчитывали в среднем 5,79 такого знака на 10 тысяч слов, к началу 2026 года показатель вырос до 11,19. Частота оксфордской запятой, которой в английском отделяют последний элемент перечисления перед союзом, увеличилась на 63%. Конструкция вида «не X, а Y» стала встречаться почти втрое чаще.
Похожая картина возникла со словарём. Группа слов, которые языковые модели используют заметно охотнее людей, выросла с 11,94 до 26,02 употребления на 10 тысяч слов. Среди характерных примеров исследователи называют delve, interplay, testament, pivotal, meticulous, landscape, underscore и tapestry. Одно такое слово ничего не доказывает, но на сотнях тысяч документов статистический сдвиг становится хорошо заметен.
Для оценки авторства команда использовала открытую модель Pangram, которая ищет статистические особенности выбора слов и построения предложений. Каждая страница получала оценку от полностью человеческого до полностью машинного текста, а значимым признаком участия ИИ исследователи считали результат от 0,2. Такой подход нельзя воспринимать как безошибочный тест. ИИ-детекторы дают ложные срабатывания и способны пропускать отредактированный машинный текст, поэтому авторы исследования рассматривают результаты прежде всего как способ измерить крупный тренд, а не установить происхождение конкретной статьи.
Выборка тоже охватывает не весь интернет. Команда брала по 10 тысяч англоязычных страниц из 49 снимков Common Crawl. В архив попадают публично доступные сайты, поэтому ресурсы с обязательной авторизацией и платным доступом представлены хуже. Даже с таким ограничением разница между сегментами оказалась большой. В 2026 году признаки участия ИИ встречались примерно на 9,4% страниц в зоне .com, на 4,6% в .org и лишь примерно на 1% страниц .edu и .gov.
Социальные сети показывают ещё более резкую картину. Pangram отдельно проанализировала свыше миллиона публикаций, которые пользователи браузерного расширения проверяли с апреля 2026 года. Среди текстов длиннее 250 слов полностью машинными модель признала около 41% длинных публикаций LinkedIn, 31% материалов Medium, 29% публикаций X, 13% Reddit и 10% Substack. В X ещё около 23% длинных текстов получили оценку смешанного авторства, поэтому почти половина проверенных материалов содержала заметный вклад ИИ. Такая выборка не случайна и не позволяет переносить проценты на все публикации платформ, но показывает масштаб машинного текста среди контента, который пользователи реально решили проверить.
Самый интересный вопрос начинается там, где заканчивается подсчёт сгенерированных страниц. Рост характерных оборотов может происходить не только потому, что интернет заполняют тексты ChatGPT, Claude и Gemini. Люди сами способны перенимать язык моделей. В отдельной работе исследователи изучили более 740 тысяч часов разговорной речи из 360 тысяч академических видео YouTube и 771 тысячи выпусков подкастов. После появления ChatGPT частота предпочитаемых моделью слов вроде delve, comprehend, boast, swift и meticulous заметно выросла даже в устной речи.
Авторы называют возможный механизм замкнутой культурной петлёй. Языковые модели обучаются на человеческих текстах, формируют собственные статистические привычки, после чего миллионы людей читают машинный текст и постепенно перенимают часть этих привычек. Следующее поколение моделей снова обучается уже на интернете, где человеческий и машинный язык всё сильнее смешаны.
Поэтому длинное тире, слово delve или идеально симметричная фраза сами по себе не превращают автора в ChatGPT. Исследование показывает более крупный сдвиг. Машинный стиль перестал быть только следствием работы чат-ботов и постепенно становится частью общего языкового фона, на котором пишут и сами люди.