ChatGPT знает вашу компанию, а Google — нет: гид по диагностике видимости сайта в ИИ

24450
ChatGPT знает вашу компанию, а Google — нет: гид по диагностике видимости сайта в ИИ

Как проверить, видит ли ваш сайт ИИ.

image

«Нас нет в нейросетях» — это не диагноз, а жалоба. За ней прячется минимум шесть разных поломок, и лечатся они противоположными способами. Модель может не знать бренд. Поисковый робот может получать отказ на первом же запросе. Одна строка в шаблоне страницы может запрещать использовать текст в генеративном ответе. Страница может нормально индексироваться, но проигрывать конкурентам при отборе источников. Система может упоминать компанию без ссылки. Переходы могут идти, но теряться в «прямых заходах».

Проверка нужна для того, чтобы разложить жалобу на диагнозы. Ниже — порядок действий: что измерять, в какой последовательности, каким инструментом и как не принять шум за результат. Первый полный проход занимает рабочий день и не требует платных сервисов.

Сначала определите, какой слой вы измеряете

Три механизма дают внешне одинаковый результат — ответ нейросети, — но проверяются по-разному.

Знания модели. Ответ без обращения к интернету. Проверяется вопросами в режиме без поиска. Важно: то, что ChatGPT знает вашу компанию, не доказывает, что ваш сайт попадал в обучающую выборку — сведения могли прийти из сторонних публикаций.

Поисковый слой. Система заранее собрала страницу и может процитировать её со ссылкой. За это отвечают OAI-SearchBot, Claude-SearchBot и PerplexityBot. Проверяется журналами сервера и режимом с поиском.

Агентский слой. Пользователь просит открыть конкретный адрес прямо сейчас; работают ChatGPT-User, Claude-User, Perplexity-User. Проверяется только журналами: у этого слоя нет надёжного договора о правилах.

Смешивать слои в одной таблице бессмысленно. Заблокированный поисковый робот новой статьёй не чинится, а устаревшие знания модели не чинятся отчётом из аналитики.

Схема диагностики видимости сайта в ИИ: проверка знаний модели без поиска, появления сайта в источниках и доступа к странице по прямому запросу пользователя.

Шаг 1. Замерьте, что модель знает без поиска

Отключите поиск, если интерфейс позволяет выбирать режим, и откройте новый диалог без персональной памяти. Задайте вопросы о компании, продукте, людях, датах, ценах и характеристиках.

Записывайте не «знает или не знает», а конкретные ошибки. Если модель уверенно называет старую цену, бывшего генерального директора или закрытый продукт — это не отсутствие видимости, а репутационная проблема, и она обычно неприятнее пустого ответа. Отдельной строкой фиксируйте, кого называют вместо вас.

Сразу отбросьте ложную надежду: запрет обучающего робота не стирает то, что модель уже усвоила, он влияет только на будущий сбор. У OpenAI за обучение, за поиск, за пользовательские запросы и за проверку рекламных страниц отвечают четыре разных агента, и цитирование обеспечивает не обучающий.

Шаг 2. Проверьте по журналам, кто доходит до сервера

Это самый недооценённый шаг и единственный источник фактов. Интерфейс отвечает на вопрос «что увидел пользователь», журнал — на вопрос «кто действительно обращался к нашему серверу». Берите минимум 30 дней.

Разделите запросы по назначению: обучение, поисковая индексация, обращения по поручению пользователя, служебные задачи. Тысячи запросов GPTBot не означают тысячи появлений в поиске ChatGPT — это разные роботы с разными задачами.

Затем смотрите коды ответа. Постоянные 403 для OAI-SearchBot, Claude-SearchBot или PerplexityBot — явная проблема доступа. Серия 429 означает, что робот упирается в ограничение частоты. В обоих случаях переписывать заголовки и первые абзацы бессмысленно, пока сервер не начнёт отвечать нормально. Повторяющийся поток 404 к давно удалённому адресу говорит, что где-то живёт устаревшая ссылка; единичный 404 не доказывает ничего.

Шпаргалка по ИИ-ботам в серверных логах: поисковые роботы, пользовательские агенты, обучающие боты и OAI-AdsBot, а также значения кодов 403, 429 и 404.

Отдельно проверьте, на что настроены фильтры. Правила прошлого года промахиваются: строки агентов меняются, GPTBot дошёл до версии 1.4, а подпись OAI-SearchBot теперь начинается с полной строки настольного браузера, поэтому шаблон под старую короткую форму её не поймает. Сверьте действующие строки по документации OpenAI и Anthropic — обе за последний год переезжали на новые адреса вместе со списками сетевых диапазонов.

Почему для агентских обращений журнал — единственная правда

OpenAI пишет в документации, что ChatGPT-User открывает страницу по запросу человека и правила robots.txt к нему могут не применяться. Perplexity занимает такую же позицию по своему пользовательскому агенту. Anthropic держит противоположную линию: все три её робота соблюдают robots.txt, включая нестандартную директиву Crawl-delay, и компания обещает не обходить проверку человека.

Это не теория. По отчёту TollBit за первое полугодие 2026 года, около 15% опознанных ИИ-агентов на европейских сайтах обращались к адресам, закрытым в robots.txt, и чаще других запрещённых страниц достигал именно пользовательский агент ChatGPT. Проверка «что написано в robots.txt» отвечает на вопрос о ваших пожеланиях, а не о реальном доступе.

Шаг 3. Найдите запреты, о которых вы забыли

Чаще всего сайт выпадает из ИИ-ответов не из-за содержимого, а из-за настройки, поставленной год назад или доставшейся вместе с шаблоном. Проверять надо четыре места.

Метатеги на уровне страницы. Самая тихая причина. Директивы nosnippet, data-nosnippet и max-snippet действуют не только на обычные фрагменты в выдаче: они распространяются на AI Overviews и AI Mode и запрещают использовать текст как прямой ввод для генеративного ответа. Значение max-snippet:0, случайно оставшееся в шаблоне рубрики, выключает страницы из ИИ-ответов Google полностью — и при этом никак не проявляется в отчётах об индексации. Проверьте метатеги и заголовок X-Robots-Tag по всем шаблонам: статьи, рубрики, страницы товаров, документация.

robots.txt, по каждому имени отдельно. Общего выключателя «все ИИ» не существует. Помните три асимметрии. Google-Extended вообще не робот: у него нет собственной строки агента, он не делает запросов и в журналах не появляется — это управляющее имя для обучения и обоснования ответов в отдельных продуктах, а за AI Overviews отвечает обычный Googlebot. YandexAdditional и YandexAdditionalBot тоже не индексируют сайт сами: они решают, можно ли использовать уже проиндексированные страницы в ответах Алисы, и правка учитывается за две-четырнадцать дней. У OpenAI разрешения раздельные, но обход может быть общим: если разрешены и обучающий, и поисковый робот, результат одного получения используется для обеих задач, а изменения файла отражаются на поисковой видимости примерно за сутки. Синтаксис удобно прогнать через анализатор robots.txt в Вебмастере.

Отдельный пункт для тех, кто покупает рекламу в ChatGPT. У OpenAI появился четвёртый агент, OAI-AdsBot, проверяющий посадочные страницы объявлений. Компания требует разрешить его, иначе страница не пройдёт проверку и объявление не будет одобрено. Привычное «запретим всех роботов OpenAI» ломает уже оплаченный канал, причём молча.

Cloudflare, до 15 сентября 2026 года. С 1 июля единственный переключатель «блокировать ИИ-роботов» заменён тремя раздельными назначениями: Search, Agent, Training. С 15 сентября Training и Agent блокируются по умолчанию на страницах с рекламой, Search остаётся разрешённым; новые умолчания получают новые домены, новые сайты действующих клиентов и все пользователи бесплатного тарифа, не выбравшие свою конфигурацию, — это зафиксировано и в журнале изменений.

Ловушка — в роботах смешанного назначения. С той же даты применяется наиболее строгое подходящее правило, и запрет Training тянет за собой Googlebot, Applebot и BingBot, даже когда Search разрешён. То есть галочка «не обучать на нас» способна снести обычную поисковую видимость. Отказаться от новых умолчаний можно в настройках доступа до 15 сентября.

Заодно посмотрите на поле use в сигналах содержимого: оно описывает, что роботу разрешено оставить у себя — ничего, цитату со ссылкой или полное воспроизведение. При включённом управляемом robots.txt значение reference добавляется автоматически. Убедитесь, что оно отражает вашу политику, а не чужую.

Search Console, новый переключатель. Раньше попасть в Поиск и не попасть в AI Overviews было нельзя иначе как через nosnippet, который заодно убивает обычный фрагмент. Теперь в настройках свойства сайт можно исключить из AI Overviews, AI Mode и генеративного Discover, сохранив обычную выдачу; Google утверждает, что это не сигнал ранжирования и не влияет на обучение. Проверьте состояние переключателя хотя бы затем, чтобы убедиться, что его не включили случайно.

Появился он не по доброй воле: 3 июня 2026 года британский регулятор обязал Google дать издателям такой отказ без потери обычной видимости, а основные обязательства вступают в силу в декабре 2026 года.

Шаг 4. Проверьте, что страницу вообще можно прочитать

Возможности роботов различаются, и рассчитывать, что каждый воспроизведёт полноценную браузерную сессию, нельзя. Google подробно описал, как устроены получение и обработка страниц его роботом; у ИИ-обходчиков этот этап устроен беднее.

Проверка простая: отключите выполнение сценариев в браузере и посмотрите, остались ли на странице заголовок, основной текст, дата, автор и внутренние ссылки. Если основной текст подгружается отдельным запросом после отрисовки — для части систем страницы просто нет.

Второй критерий — извлекаемость. На конкретный вопрос на странице должен находиться однозначный ответ, а важная цифра должна сопровождаться датой, единицами измерения и контекстом. При этом не ведитесь на распространённые мифы: нет оснований утверждать, что ИИ «читает только первый абзац» или предпочитает определённую длину блока. Google, кстати, отдельно свёл рекомендации для генеративных функций в один документ, и никакой особой разметки под ИИ там не появилось.

Шаг 5. Замерьте частоту, а не собирайте снимки экрана

Один ответ ChatGPT, Алисы или Perplexity не доказывает ничего. Системы строят ответ заново при каждом запуске, набор источников меняется, и Яндекс сам предупреждает о разных ответах на один запрос в разное время.

Рабочий минимум: 20 вопросов, каждый прогоняется не меньше трёх раз. Три — не отраслевой стандарт, а порог, после которого единичный ответ перестаёт восприниматься как метрика. Если бренд появился один раз из трёх, в таблице стоит 33%, а не галочка «присутствует».

Вопросы формулируйте как вопросы пользователя, а не как поисковые ключи. Нужны брендовые, категорийные без названия компании, сравнительные и сценарии выбора. Для издания об информационной безопасности «какие русскоязычные издания регулярно пишут об уязвимостях» даст больше, чем «новости информационной безопасности».

Считайте шесть показателей раздельно: долю упоминаний, долю ответов с активной ссылкой, положение среди источников, точность фактов, свежесть и конкурентную долю. Сводить их в один балл нельзя: бренд может постоянно появляться без ссылки, а другой сайт упоминаться редко, но всегда со ссылкой.

Условия теста фиксируйте и повторяйте одинаково. Прогон с поиском и без него держите отдельно — иначе вы смешиваете первый слой со вторым. И не принимайте фразу «покажи источники» за проверку: если модель работала без поиска, она способна назвать правдоподобный адрес, который никогда не открывала.

Какие системы брать в набор

Универсального рейтинга «ИИ-поиска в России» не существует, и это видно по расхождению замеров. Опрос OMI в марте 2026 года на выборке 2328 человек дал Алисе AI 71%, ChatGPT 42%, GigaChat 38%. Опрос МТС Линк во втором квартале на выборке 1010 человек показал совсем другое: Алиса 46%, GigaChat 45%, ChatGPT 38%. Разные анкеты, разный предмет измерения, плюс структурное занижение ChatGPT из-за закрытого с российских адресов доступа.

Для аудита это значит одно: набор систем подбирайте по своей аудитории — по переходам, опросам читателей и тематике, — а не по чужому рейтингу.

Шаг 6. Снимите официальные отчёты

«Видимость сайта в Алисе AI». Раздел появился в Вебмастере 7 апреля 2026 года и показывает долю упоминаний среди источников, её динамику, примеры запросов и сайты той же тематики, которые цитируются чаще. Данные хранятся за три месяца и обновляются еженедельно; аудиторию быстрых ответов Яндекс оценивает в 46,5 млн человек в месяц.

Читать отчёт нужно с поправкой. Статистика считается не по всему спросу, а по запросам, где сайт уже стоит достаточно высоко в обычной выдаче. Нулевой показатель поэтому не означает отдельной «проблемы с Алисой» — сначала проверьте обычную поисковую видимость. Кликов и показов раздел не даёт принципиально.

Отчёт по генеративным функциям в Search Console. Запущен 3 июня 2026 года и показывает показы страниц в AI Overviews, AI Mode и генеративном Discover с разбивкой по страницам, странам, устройствам и датам. Кликов, показателя переходов и запросов в текущей версии нет, данные задним числом не пересчитываются, доступ открывался постепенно.

Оба отчёта отвечают на вопрос «попадаю ли я в источники» и не отвечают на вопрос «что это принесло». Не подменяйте одно другим.

Шаг 7. Проверьте, доходят ли переходы до аналитики

Частая поломка: сайт цитируется, люди переходят, а в отчётах пусто.

Первое — метка utm_source=chatgpt.com, которую OpenAI добавляет к ссылкам в поисковых цитированиях и блоке дополнительных источников. Во встроенных ссылках внутри разговора и в мобильном приложении её нет.

Второе — масштаб потерь. По замеру на выборке более 446 тысяч сеансов, около 70% переходов из ИИ приходят без заголовка источника и попадают в «прямые заходы». Любая ваша цифра по ИИ-трафику — нижняя граница, а не факт.

Третье — канал AI Assistant, который Google Analytics добавил 13 мая 2026 года: сеансы с опознанных сервисов автоматически получают источник ai-assistant. Слепые зоны существенные — история не пересчитывается, Perplexity в перечень не входит, клики из AI Overviews считаются обычным поиском, — поэтому собственную группу каналов имеет смысл оставить рядом со встроенной.

Цепочка от публикации страницы до перехода из ответа ИИ: получение страницы роботом, разрешение использования, чтение контента, выбор источника, ссылка, переход пользователя и фиксация визита аналитикой.

Шаг 8. Проверьте, кому достаются послабления

Если ИИ-роботам разрешено обходить проверку человека или ограничение частоты, посмотрите, по какому признаку выдаётся исключение. Строка User-Agent подделывается тривиально: примитивный сканер представляется GPTBot и пользуется вашей же поблажкой.

Сверяйте имя с сетевыми признаками. Списки диапазонов публикуют OpenAI и Anthropic, причём у рекламного робота OpenAI такого файла на момент запуска не было — там остаётся обратный DNS. Отдельно перепроверьте пути к файлам Google: в марте 2026 года диапазоны адресов его роботов переехали на новый адрес, и старые ссылки в скриптах проверки перестают работать молча.

Полезно знать, что статус «проверенный робот» у Cloudflare переопределён: он лишь делает робота допустимым в рамках его категории, а робот, воспроизводящий содержимое целиком, такого статуса не получает. Для агентов, работающих через посредников, обсуждается криптографическая подпись запросов — если вы выдаёте исключения, это направление стоит держать в виду.

Что проверять не надо, вопреки популярным советам

Наличие llms.txt. В августе 2026 года формат получил вторую версию с описанием способов указать агенту на Markdown-версию страницы; для существующих файлов это мелкая правка. На видимость это не влияет. Ahrefs проанализировала 137 210 доменов: 97% опубликованных файлов не получили за май ни одного запроса, крупнейшая категория обратившихся — сервисы поискового аудита, а на роботов оперативного поиска пришлось около процента запросов. Показательно и то, что файл не запрашивают даже там, где его нет: значит, его не ищут. Google со своей стороны прямо указывает, что никакой особой разметки для генеративных функций не требуется.

Если файл генерируется автоматически системой управления содержимым — вот его как раз просмотрите. Ahrefs зафиксировала робота, изучающего llms.txt именно как поверхность для внедрения инструкций.

Замер «упоминаний» без разделения на слои. Сводная оценка «видимость в ИИ 42%» не говорит ничего, пока непонятно, что именно замерялось: знания модели, поисковый слой или агентские обращения. Инструмент, который не показывает режим прогона, не показывает и результат.

Проверьте своё содержимое на инструкции для агентов

Пункта нет ни в одном типовом чек-листе, а стоило бы. Для ИИ-агента ваш сайт — недоверенный ввод, и содержимое могли изменить не вы.

В апреле 2026 года группа анализа угроз Google просканировала архив в два-три миллиарда страниц в месяц и зафиксировала рост на 32% вредоносной категории с ноября 2025 по февраль 2026 года. Академический замер по 1,2 млрд адресов выявил 15,3 тысячи подтверждённых случаев на 11,7 тысячи страниц, причём около 70% инструкций спрятаны в принципиально невидимых каналах — заголовках HTTP, комментариях, структурированных данных и метаданных, — а 54 шаблона формулировок дают 95% всех случаев. Unit 42 задокументировала первый реальный случай, где внедрённая инструкция была рассчитана на обход автоматизированной проверки рекламы.

Практически: просмотрите пользовательские комментарии, метаданные, скрытые элементы и автогенерируемые файлы. Модерация теперь защищает не только читателя и поисковую репутацию, но и автоматизированных клиентов, которые придут за вашим текстом.

Последняя проверка: перевести упоминания в деньги

Упоминание без ссылки не бесполезно, но и не равно переходу, а разница считается отдельно.

Ориентир по потерям даёт первый рандомизированный полевой эксперимент, проведённый исследователями Indian School of Business и Университета Карнеги — Меллона на 1065 пользователях настольного Chrome: появление AI Overviews снижает переходы на внешние сайты примерно на 40% и увеличивает долю запросов без переходов примерно на треть, причём удовлетворённость пользователей не растёт.

Соотношение обходов к переходам публикует Cloudflare Radar, и разброс там измеряется тремя порядками. Читать его надо с оговоркой самой компании: переходы из мобильных приложений не передают заголовок источника, поэтому расчёты могут завышать соотношения, а картина сильно меняется по отраслям. Смотрите на тренд, а не на цифру из презентации.

Направление стоит держать в поле зрения: Cloudflare разворачивает оплату за обход в оплату за использование, потому что одна страница может быть получена единожды и процитирована тысячи раз, а другая — скачана сотни раз и не попасть никуда. Если оплату действительно привяжут к использованию, ваш замер цитирований перестанет быть аналитикой и станет финансовым учётом.

Контрольный список

  1. Прогоните вопросы в режиме без поиска, запишите фактические ошибки и конкурентов, которых называют вместо вас.
  2. Разберите журналы за 30 дней, разделив роботов по назначению.
  3. Проверьте коды 403, 404 и 429 отдельно для каждого поискового робота.
  4. Обновите шаблоны фильтров под новые строки агентов и новые адреса файлов с диапазонами.
  5. Проверьте метатеги nosnippet, max-snippet и заголовок X-Robots-Tag по всем шаблонам страниц.
  6. Проверьте robots.txt по каждому имени отдельно, включая рекламный робот, если покупаете рекламу в ChatGPT.
  7. Проверьте настройки Search, Agent и Training в Cloudflare и решите, отказываетесь ли от новых умолчаний до 15 сентября.
  8. Сверьте значение use в сигналах содержимого со своей политикой.
  9. Убедитесь, что в Search Console не включён отказ от генеративных функций.
  10. Откройте ключевые страницы без выполнения сценариев и проверьте, остались ли текст, дата и автор.
  11. Соберите 20 вопросов четырёх типов и прогоните каждый трижды, отдельно с поиском и без.
  12. Считайте шесть показателей раздельно, не сводя их в один балл.
  13. Снимите «Видимость сайта в Алисе AI» и отчёт по генеративным функциям.
  14. Проверьте разбор переходов: метку, канал AI Assistant, собственную группу каналов.
  15. Посмотрите, по какому признаку защита выдаёт исключения ИИ-роботам.
  16. Просмотрите пользовательское содержимое и автогенерируемые файлы на предмет внедрённых инструкций.
  17. Сохраните исходные значения и повторите тот же набор тестов через месяц в тех же условиях.

После такого прохода жалоба «нас нет в ИИ» распадается на конкретные диагнозы с разными сроками и разной ценой исправления. Это и есть результат проверки: не единая красивая оценка, а понимание, в каком именно месте рвётся цепочка между публикацией страницы и появлением сайта в ответе пользователя.

SECURITM
ФСТЭК · Обновление 2026
03
сен

ФСТЭК и Правительство обновили требования.
Что изменилось этим летом и что важно учесть?

Разберём 3 сентября в 11:00.

Регистрация
Реклама. 18+ ООО «Секъюритм» ИНН 7820074059