Главная/SEO/Кого антибот режет по ошибке: YandexBot, ИИ-краулеры и полезные боты

Кого антибот режет по ошибке: YandexBot, ИИ-краулеры и полезные боты

ВВиталий ГротОбновлено 6 августа 20260 просмотра7 мин

Защита от ботов опасна не тем, что пропустит лишнего, а тем, что отрежет нужного. Настоящий YandexBot регулярно приходит с подсетей, которых нет в официальном списке Яндекса, и получает капчу вместо страницы. Разбираем, как увидеть это в логе за минуту, что делать с ИИ-краулерами и почему заголовок X-Robots-Tag: noarchive пугает людей зря.

Почему настоящий поисковик попадает под блокировку

Антибот подтверждает робота схемой IP-PTR-IP: берёт адрес визита, запрашивает по нему обратную DNS-запись, а по ней снова прямую. Совпало — робот настоящий. Схема надёжная и именно поэтому ломается предсказуемым образом: она работает только там, где поисковик сам поддерживает свои DNS-записи в порядке.

Яндекс периодически запускает роботов с подсетей, которых ещё нет в его официальном списке. Обратная запись выглядит яндексовской, но цепочку проверка не проходит — и настоящий YandexBot получает капчу или уезжает в лог со статусом FAKE, то есть «маскируется под известного бота». По наблюдениям разработчика, ситуация повторяется в среднем раз в один-два месяца, а подтверждение новой подсети через поддержку Яндекса занимает одну-две недели.

ПодсетьКогда всплылаЧто происходило
45.148.65.0/24февраль 2026Визиты YandexBot в статусе FAKE
141.8.183.0/24февраль 2026То же, параллельно с предыдущей
45.138.0.0/24май 2026Всплывала повторно после затишья
93.158.167.0/24июнь 2026Последняя из публично разобранных

Список открытый — завтра появится следующая. Поэтому запоминать надо не адреса, а порядок действий: добавить подсеть правилом ALLOW в первую таблицу правил, затем сбросить кэш PTR в админке. Второй шаг пропускают чаще всего, и зря: без него старые записи о роботе ещё несколько дней считаются неподтверждёнными, и человек решает, что правило не сработало.

Вопрос

Откуда мне знать, что подсеть «яндексовская», а не парсер прикидывается? Сверьте с yandex.ru/ips и прогоните адрес по инструкции Яндекса о проверке роботов. Если поисковик подсеть не подтверждает, а трафик с неё ведёт себя как робот — это повод написать в поддержку Яндекса, а не сразу открывать доступ. Открывать ALLOW «на всякий случай» нельзя: этим вы сами сделаете дыру, через которую пойдут парсеры под видом YandexBot.

Как за минуту увидеть, что режете своих

Ложное срабатывание видно в логе запросов раньше, чем в аналитике. Смотреть надо статус визита у поисковых роботов — он и есть диагноз.

Статус в логеЧто означаетНорма для поисковика?
GOODIPРобот подтверждён по цепочке IP-PTR-IP, пропущен без проверкиДа, это целевое состояние
FAKEПредставился известным ботом, но проверку подлинности не прошёлНет — либо парсер, либо новая подсеть поисковика
STOPЗаблокирован правиломНет, если это настоящий поисковик
MISSНе прошёл проверку, показана страница проверкиДля робота — нет, для анонимного посетителя — да

Порядок разбора простой. Фильтруете лог по User-Agent поисковика, смотрите статусы за последние сутки. Если у YandexBot или Googlebot преобладает GOODIP — всё в порядке. Если появились FAKE и STOP, берёте адрес визита, сверяете с официальным списком поисковика и дальше действуете по разделу выше.

Вторая точка проверки — панели вебмастеров. В Яндекс.Вебмастере ложное срабатывание выглядит как «Фатальная ошибка. Не удалось загрузить страницу» или как рост «малоценных» страниц. В Search Console — как всплеск в отчёте «Индексирование страниц» по причинам «Ошибка сервера 5xx» и «Страница с переадресацией». Аналитика покажет ту же беду позже и косвенно: обвал органики через несколько дней.

Важно

Проверяйте лог после каждого изменения правил, а не раз в квартал. Правило, отрезавшее поисковик, стоит вам не «немного трафика», а выпадения страниц из индекса — и обратно они возвращаются неделями, а не за один обход.

ИИ-краулеры: пускать или резать

Позиция разработчика Антибота прямая: по умолчанию ИИ-ботам доступ не давать — нагрузка на сервер есть, отдачи нет. Аргумент честный, но решение здесь зависит от того, зачем вам сайт, поэтому разберём обе стороны.

Против: ИИ-краулеры создают ощутимую нагрузку; через ИИ-сервисы научились массово парсить контент в обход защит, если боты разрешены; отдельным потоком идут «искатели уязвимостей» — боты, которые с помощью ИИ автоматически проверяют вашу CMS и плагины на дыры, маскируясь под обычный интерес.

За: если ИИ-сервис ссылается на источник, из него приходят живые люди с высоким намерением. Это и есть GEO — оптимизация под ответы нейросетей, о которой мы пишем отдельно. Практический нюанс, который стоит знать заранее: чтобы попадать в ответы ChatGPT, нужно быть видимым в Bing — данные для поиска он берёт оттуда, и запрет краулера тут вторичен.

КтоКак разрешитьСтоит ли
ChatGPT (OpenAI)Готовая кнопка «Разрешить ChatGPT ботов» в правилах — сама держит списки IP в актуальном видеДа, если вам нужен трафик из ответов ИИ
Gemini, АлисаНичего делать не нужно — отдельных разрешений не требуютВопрос не возникает
Claude, Perplexity и прочиеВручную: официальные подсети в первую таблицу правилПо ситуации: чистой обратной DNS-записи у большинства нет, проверить их через PTR нельзя
Безымянные ИИ-сканерыНе разрешатьНет. Это не источник трафика, а разведка уязвимостей
Вопрос

Хочу трафик из нейросетей, но не хочу отдавать тексты на обучение. Так можно? Частично. Пускаете конкретных ботов, которые дают ссылки, и добавляете в шаблон мета-тег noarchive — он запрещает показ сохранённой копии. Полной защиты от обучения это не даёт: если контент доступен людям, он доступен и обучению. Реалистичная цель — не спрятать текст, а быть тем источником, на который ссылаются.

X-Robots-Tag: noarchive — это не noindex

Самая частая паника вокруг антибота: «скрипт закрыл сайт от индексации, вижу X-Robots-Tag». Не закрыл. Это разные директивы, и путает их одно только внешнее сходство названий.

  • noarchive — «не показывай сохранённую копию». Страница индексируется, ранжируется и приносит трафик, из выдачи убирается только ссылка на копию.
  • noindex — «не бери страницу в индекс». Вот это и есть исчезновение из поиска.

Антибот штатно умеет отдавать именно noarchive — функция появилась в версии 8.109 ещё в 2022 году. Если сайт действительно пропал из индекса и вы видите noindex — источник другой: SEO-плагин, настройки CMS, случайно оставленный запрет на тестовом окружении. Ищите там, а не в антиботе.

Вопрос

Зачем вообще прятать сохранённую копию? Чтобы парсер не забирал ваш текст из кэша поисковика в обход защиты. Смысл ровно в этом: закрыли дверь на сайте — закройте и запасной вход через сохранённую копию.

Полезные боты, которых нельзя терять

Поисковики — не единственные роботы, которые вам нужны. Агрессивные правила бьют по инфраструктуре, которой вы пользуетесь каждый день и замечаете потерю не сразу.

  • PageSpeed Insights и Lighthouse. Отрежете — перестанете измерять скорость и Core Web Vitals; проблема всплывёт, когда просядут позиции.
  • Боты предпросмотра ссылок: Telegram, ВКонтакте, соцсети. Отрежете — ваши ссылки в мессенджерах станут голым адресом без картинки и заголовка. Для контентного проекта это прямая потеря переходов.
  • RSS-читалки и агрегаторы — если у вас есть подписчики, вы их просто выключите.
  • Сервисы мониторинга доступности. Отрежете — узнаете о падении сайта от клиентов, а не от системы.

Список тех, кого стоит пускать, разработчик ведёт отдельной страницей FAQ. Правило простое: включайте правила по одному и после каждого смотрите лог. Пакетное «включить всё сразу» — самый быстрый способ отрезать себе полезное и не понять, какое именно правило виновато.

Когда «капча не грузится» — не ваша вина

Отдельный симптом, который выглядит как ложное срабатывание, но им не является: живой посетитель без VPN видит «Идёт загрузка…» и дальше не проходит, а с VPN всё работает. Хостинг при этом российский, и вчера всё было нормально.

Единой подтверждённой причины у этого симптома нет — это открытый вопрос, а не решённая проблема. Диагностику начинают так: смотрят в консоли браузера, какая именно сетевая ошибка блокирует загрузку скрипта; проверяют, не попал ли под блокировку внешний адрес, к которому идёт проверка; проверяют настройки TLS на сервере. Признак «работает только через VPN» чаще указывает на блокировку внешней инфраструктуры, а не на ошибку настройки — об этом отдельный разбор в статье про облако, РКН и Cloudflare.

Важно

Не чините то, что не сломано у вас. Перед тем как перебирать правила и переустанавливать скрипт, проверьте базовое: воспроизводится ли проблема с других устройств и у другого провайдера. Если только у одного — причина на стороне сети посетителя, и правки на сайте её не вылечат.

Источники
  1. Проверка роботов Яндекса — yandex.ru/ips и документация «Как проверить, что робот принадлежит Яндексу»
  2. Популярные боты, которых можно пустить или не пустить — antibot.cloud/FAQ/good-bots.html
  3. X-Robots-Tag: NOARCHIVE — для чего нужен — antibot.cloud/FAQ/noarchive.html
  4. Результат проверки посетителей (причина блокировки) — antibot.cloud/FAQ/result.html
  5. Описание страницы «Лог запросов» — antibot.cloud/FAQ/hits.html
  6. Наблюдения по «секретным» подсетям Яндекса и ИИ-ботам — Telegram-канал разработчика «Antibot Cloud News», 2025–2026
Опрос
Что для вас сейчас приоритет в продвижении?
304 голоса·голосуют один раз
Оцените статью
0 · 0 оценкиСпасибо за оценку!

Комментарии

Загружаем проверку…
Комментарий появится после проверки автором.

Загружаем комментарии…