Как определить ИИ в тексте: проверка на нейросеть онлайн

272
Как определить ИИ в тексте: проверка на нейросеть онлайн

Наш коллега сам написал ВКР, а потом решил определить ИИ в тексте двумя детекторами ИИ. Первый оценил вероятность генерации в 92%, второй на 99% счел текст человеческим. Фрагмент был один и тот же.

Эта история на Пикабу хорошо показывает, что на самом деле дает проверка текста на ИИ: вероятность, а не вердикт.

Все про нейросети, без инфошума и воды.

Что такое детектор ИИ и как он работает

Принцип работы AI-детекторов

ИИ-детектор анализирует структуру предложений, лексику, повторы, переходы и предсказуемость текста, чтобы оценить вероятность машинной генерации. Ни водяных знаков, ни метаданных, ни истории создания файла детектор ИИ не видит. У него есть только сам текст.

Внутри почти всегда классификатор, построенный на машинном обучении. Его обучают на двух корпусах: тексты людей и тексты, которые написали ChatGPT, Claude, Gemini и другие модели. Дальше алгоритмы NLP ищут в новом тексте паттерны письма, типичные для каждой группы.

Языковая модель на каждом шаге выбирает вероятное продолжение, поэтому ее текст идет гладко. Человек чаще делает неожиданный ход: редкое слово, обрыв фразы, длинное предложение сразу после короткого.

Когда длина предложений держится в узком коридоре, а абзацы собраны по одной схеме, оценка ползет вверх. Искусственный интеллект пишет ровнее людей, и детектор реагирует именно на ровность, а не на смысл.

Анализ текста идет по статистике, поэтому детектор отвечает на вопрос «похоже ли это на машинный текст», а не «кто это написал». Модель машинного обучения видит сходство с тем, на чем ее учили, и не больше.

Чем детектор ИИ отличается от проверки на плагиат

Он оценивает паттерны письма, а не ищет совпадения с существующими публикациями.

Антиплагиат работает с фактом. Фрагмент либо совпал с найденным источником, либо нет, и совпадение можно открыть. Даже когда искусственный интеллект помогает искать перефразирование, результат опирается на найденный документ. У детектора источника нет: нейросеть генерирует текст, которого раньше не существовало.

Сгенерированный текст часто получает высокую уникальность. Честный пересказ чужой статьи своими словами, наоборот, может получить низкую долю ИИ и заметные заимствования.

Проверка текста на ИИ онлайн: 7 сервисов

Проверка текста на ИИ доступна и в российских, и в зарубежных сервисах: в подборке четыре и три соответственно. Лимиты символов, число языков и функции отчетов у каждого свои, поэтому в таблице стоит только то, что написано на официальных страницах. Прочерк значит, что на странице сервиса этих данных нет.

Сервис

Бесплатно

Платно

Русский язык

Файлы

Вид результата

Антиплагиат

Демопроверка до 8 000 знаков, ИИ-проверка в ней не заявлена

FULL L от 466 ₽, до 200 000 знаков

Да

—

Процент и подсвеченные фрагменты, отчет

Text.ru

Нет

Пакеты нейросимволов, 100–50 000 знаков

Да

—

Вероятность в процентах

GigaCheck

Демо-версия, 20–1000 слов

—

Да

—

Оценка по преобладающему типу текста

aidetector.ru

Без регистрации, объем без ограничений

Платных тарифов нет

—

Загрузка файла, форматы не указаны

Вероятность и отчет с фрагментами

Detecting-AI

До 15 000 знаков

$14 в месяц или $84 в год, до 160 000 знаков

Да

TXT, PDF, DOCX

Оценка и подсветка предложений

ZeroGPT

Бесплатный тариф без карты

—

Заявлены «все языки»

Пакетная загрузка

Процент, подсветка, PDF-отчет

GPTZero

Поле на 10 000 знаков

—

Нет в списке

—

Подсветка по предложениям

Антиплагиат. Сервис знаком многим по учебным работам: проверяет и заимствования, и ИИ-контент. Разработчик заявляет распознавание ChatGPT, DeepSeek, Gemini, Claude и Алисы AI, а долю ошибок классификации оценивает не выше 1%. Минус — полноценная проверка на генерацию ИИ идет в платном тарифе: в описании бесплатной демопроверки ИИ-анализ не упомянут.

Text.ru. Удобен тем, кто уже проверяет там уникальность. Детектор ChatGPT и других моделей выдает вероятность в процентах, по заявлению сервиса распознает также DeepSeek, Gemini и Claude. Минус: бесплатно проверить текст на ИИ здесь нельзя, сервис пишет об этом на странице детектора.

GigaCheck. Бесплатная демо-версия от Сбера работает на сайте и через Telegram-бот, принимает от 20 до 1000 слов на русском языке. По описанию разработчика, текст оценивается по преобладающему типу контента, а поиск по отдельным интервалам пока в разработке.

aidetector.ru. Этим сервисом мы пользуемся сами. Он бесплатный, не просит регистрацию и принимает тексты любого объема, в отчете показывает подозрительные фрагменты. Минус — на сайте нет данных о том, на каких языках и моделях сервис проверен.

Detecting-AI. Среди зарубежных это самый прозрачный детектор ИИ по условиям: 15 000 знаков бесплатно, 160 000 на платном тарифе, подсветка по предложениям. Файлы TXT, PDF и DOCX разбираются прямо в браузере. Минус — отсканированные PDF сервис не читает, а оплата в долларах.

ZeroGPT. Подсвечивает каждое предложение, которое считает машинным, и показывает общую долю на шкале. В числе функций — пакетная загрузка файлов и PDF-отчет по каждой проверке. Минус — поддержка «всех языков» заявлена без списка и без данных о точности на русском.

GPTZero. Сильная сторона — проверка по предложениям с цветовой подсветкой. Но сервис официально поддерживает английский, немецкий, португальский, французский и испанский. Русского в этом списке нет, поэтому на русском тексте его оценку стоит воспринимать с особой осторожностью.

Есть и «Проверка текста на сгенерированность» в Лаборатории Яндекса. В таблицу мы ее не включили: официальная страница закрыта для автоматического чтения, и сверить условия не удалось.

Почему бесплатные версии слабее платных, видно по цифрам. Бесплатный доступ режет объем: 8 000 знаков против 200 000 у Антиплагиата, 15 000 против 160 000 у Detecting-AI. У Антиплагиата платный тариф к тому же проверяет по полной базе источников, а демопроверка — по ограниченной.

Новые детекторы, изменения в старых и в целом про ии мы пишем в телеграм-канале про нейросети.

Как проверить текст на нейросеть: пошаговая инструкция

  1. Убрать из документа оглавление, список литературы, таблицы и код.

  2. Разбить большой документ на смысловые части, но не мельче страницы.

  3. Проверить текст на нейросеть минимум в двух сервисах с разной логикой.

  4. Сравнить итоговые оценки между собой.

  5. Открыть подсвеченные фрагменты и прочитать их глазами.

  6. Решать по совокупности сигналов, а не по одному проценту.

Подготовка текста к проверке

Список литературы, оглавление и шапки таблиц однородны по структуре, и детектор легко принимает их за машинный текст. Их убирают до проверки.

Размер фрагмента тоже влияет: проверка текста на ИИ опирается на статистику. На трех-четырех предложениях она не набирается, и оценка скачет от запуска к запуску. Большой документ, наоборот, лучше делить на главы: средний процент по восьмидесяти страницам прячет главное — какой именно раздел вызвал подозрение.

Форматирование стоит снять. Нумерация, переносы и разметка иногда меняют оценку, хотя смысл остается прежним.

Как интерпретировать результат детектора

Результат AI-детектора часто отображается как вероятность или доля ИИ-, смешанного и человеческого контента; формат результата зависит от сервиса. Поэтому одна и та же цифра читается по-разному. У Text.ru 80% — это вероятность, что текст создан нейросетью. У ZeroGPT шкала показывает долю ИИ внутри текста, то есть примерно какая часть фрагментов похожа на машинную.

Анализ на уровне предложений позволяет выделять конкретные фрагменты с более высокой вероятностью ИИ-генерации, если такая функция поддерживается сервисом. Подсветка фраз полезнее итоговой цифры. Часто подсвечены определения, перечисления и вводные обороты, которые человек пишет так же шаблонно, как модель.

Точность ИИ-детекторов не достигает 100%, поэтому результат не следует использовать как единственное доказательство происхождения текста. История с ВКР — ровно этот случай. Один и тот же фрагмент получил 92% вероятности ИИ в одном сервисе и 99% человека в другом. Какие детекторы это были, автор поста не указывает.

Основные признаки текста, написанного ИИ

Лингвистические признаки ИИ-контента

Ложные срабатывания возможны на формальном, шаблонном или сильно отредактированном человеческом тексте, а также на переработанном ИИ-контенте.

Предсказуемые слова. ChatGPT и другие модели держатся нейтрального словаря и редко берут разговорную лексику, жаргон или неудобный оборот.

Повторяемость. Одна и та же связка или один оборот встречаются по нескольку раз на странице.

Обтекаемость. Вместо имен и цифр — «ряд специалистов», «по имеющимся данным», «в большинстве случаев».

Слишком чистый текст. Опечаток нет, пунктуация выверена, повторов слов почти нет. Живой черновик обычно грязнее, а искусственный интеллект редко оставляет опечатки.

Структурные особенности машинного текста

Однотипный синтаксис. Предложения близки по длине, начинаются похоже и строятся по одной схеме.

Одинаковые переходы. Каждый абзац открывается связкой и закрывается мини-выводом.

Симметрия. У каждого раздела столько же пунктов, сколько у соседнего, а списки тянутся тройками. Модели машинного обучения часто выдают такую структуру по умолчанию.

Анализ текста по этим признакам работает только в сумме. Редактор, который двадцать лет пишет пресс-релизы, может выдать такую же картину без всякой нейросети.

Какие тексты и документы можно проверять на ИИ

Проверка PDF, Word и других документов

Некоторые детекторы поддерживают загрузку PDF, Word и TXT, пакетную обработку и отчеты; эти возможности нельзя считать универсальными. Из семи сервисов конкретный список форматов называет только Detecting-AI: TXT, PDF и DOCX. ZeroGPT заявляет пакетную загрузку и PDF-отчет, Антиплагиат — скачиваемый отчет.

Со сканами отдельная история. В отсканированном PDF нет текстового слоя, и анализ текста просто не на чем строить. Такой файл сначала распознают, а распознавание добавляет свои ошибки.

Проверка эссе, рефератов и учебных работ

Учебные работы проверяют чаще всего, и именно здесь цена ошибки выше: за процентом стоит оценка и репутация автора. Поэтому проверка текста на ИИ в учебе требует особой аккуратности. Процент от одного сервиса не должен становиться основанием для санкций против автора.

Автору, который получил высокую оценку на своем тексте, помогает история правок. В Google Docs и Word видно, как текст рос по абзацу, с откатами и переписыванием.

Как повысить надежность проверки текста на ИИ

Использовать несколько детекторов. Совпадение двух сервисов с разной логикой значит больше, чем повтор одного и того же.

Проверять достаточно большой фрагмент. На паре абзацев анализ на использование ИИ почти ничего не показывает.

Помнить про отредактированный ИИ-текст. Сгенерированный и переписанный человеком текст детекторы распознают хуже всего. Низкий процент здесь тоже ничего не доказывает.

Не делать вывод по одному проценту. Подсвеченные фразы показывают, на чем сработал алгоритм, и их стоит читать глазами.

Оценивать сам текст. Автор истории с ВКР предлагает смотреть на другое: решает ли текст задачу, проверяются ли факты, видна ли экспертиза, может ли автор объяснить написанное.

Все про нейросети, без инфошума и воды.

AI ИИ
Alt text
Обращаем внимание, что все материалы в этом блоге представляют личное мнение их авторов. Редакция SecurityLab.ru не несет ответственности за точность, полноту и достоверность опубликованных данных. Вся информация предоставлена «как есть» и может не соответствовать официальной позиции компании.
Конференция по кибербезопасности ZeroNights – show me ur hack Узнайте про техники взлома систем, наболевшие проблемы кибербезопасности и методы предотвращения угроз. 30 сентября, СПб — билеты уже в продаже! Купить билет Реклама. ООО «Кибер Сервис», ИНН 7725496205. 18+

Life Hack

Сообщество по информационной безопасности. Мы в телеграме - https://t.me/haccking