Кого антибот режет по ошибке: YandexBot, ИИ-краулеры и полезные боты
Защита от ботов опасна не тем, что пропустит лишнего, а тем, что отрежет нужного. Настоящий YandexBot регулярно приходит с подсетей, которых нет в официальном списке Яндекса, и получает капчу вместо страницы. Разбираем, как увидеть это в логе за минуту, что делать с ИИ-краулерами и почему заголовок X-Robots-Tag: noarchive пугает людей зря.
Почему настоящий поисковик попадает под блокировку
Антибот подтверждает робота схемой IP-PTR-IP: берёт адрес визита, запрашивает по нему обратную DNS-запись, а по ней снова прямую. Совпало — робот настоящий. Схема надёжная и именно поэтому ломается предсказуемым образом: она работает только там, где поисковик сам поддерживает свои DNS-записи в порядке.
Яндекс периодически запускает роботов с подсетей, которых ещё нет в его официальном списке. Обратная запись выглядит яндексовской, но цепочку проверка не проходит — и настоящий YandexBot получает капчу или уезжает в лог со статусом FAKE, то есть «маскируется под известного бота». По наблюдениям разработчика, ситуация повторяется в среднем раз в один-два месяца, а подтверждение новой подсети через поддержку Яндекса занимает одну-две недели.
| Подсеть | Когда всплыла | Что происходило |
|---|---|---|
| 45.148.65.0/24 | февраль 2026 | Визиты YandexBot в статусе FAKE |
| 141.8.183.0/24 | февраль 2026 | То же, параллельно с предыдущей |
| 45.138.0.0/24 | май 2026 | Всплывала повторно после затишья |
| 93.158.167.0/24 | июнь 2026 | Последняя из публично разобранных |
Список открытый — завтра появится следующая. Поэтому запоминать надо не адреса, а порядок действий: добавить подсеть правилом ALLOW в первую таблицу правил, затем сбросить кэш PTR в админке. Второй шаг пропускают чаще всего, и зря: без него старые записи о роботе ещё несколько дней считаются неподтверждёнными, и человек решает, что правило не сработало.
Откуда мне знать, что подсеть «яндексовская», а не парсер прикидывается? Сверьте с yandex.ru/ips и прогоните адрес по инструкции Яндекса о проверке роботов. Если поисковик подсеть не подтверждает, а трафик с неё ведёт себя как робот — это повод написать в поддержку Яндекса, а не сразу открывать доступ. Открывать ALLOW «на всякий случай» нельзя: этим вы сами сделаете дыру, через которую пойдут парсеры под видом YandexBot.
Как за минуту увидеть, что режете своих
Ложное срабатывание видно в логе запросов раньше, чем в аналитике. Смотреть надо статус визита у поисковых роботов — он и есть диагноз.
| Статус в логе | Что означает | Норма для поисковика? |
|---|---|---|
| GOODIP | Робот подтверждён по цепочке IP-PTR-IP, пропущен без проверки | Да, это целевое состояние |
| FAKE | Представился известным ботом, но проверку подлинности не прошёл | Нет — либо парсер, либо новая подсеть поисковика |
| STOP | Заблокирован правилом | Нет, если это настоящий поисковик |
| MISS | Не прошёл проверку, показана страница проверки | Для робота — нет, для анонимного посетителя — да |
Порядок разбора простой. Фильтруете лог по User-Agent поисковика, смотрите статусы за последние сутки. Если у YandexBot или Googlebot преобладает GOODIP — всё в порядке. Если появились FAKE и STOP, берёте адрес визита, сверяете с официальным списком поисковика и дальше действуете по разделу выше.
Вторая точка проверки — панели вебмастеров. В Яндекс.Вебмастере ложное срабатывание выглядит как «Фатальная ошибка. Не удалось загрузить страницу» или как рост «малоценных» страниц. В Search Console — как всплеск в отчёте «Индексирование страниц» по причинам «Ошибка сервера 5xx» и «Страница с переадресацией». Аналитика покажет ту же беду позже и косвенно: обвал органики через несколько дней.
Проверяйте лог после каждого изменения правил, а не раз в квартал. Правило, отрезавшее поисковик, стоит вам не «немного трафика», а выпадения страниц из индекса — и обратно они возвращаются неделями, а не за один обход.
ИИ-краулеры: пускать или резать
Позиция разработчика Антибота прямая: по умолчанию ИИ-ботам доступ не давать — нагрузка на сервер есть, отдачи нет. Аргумент честный, но решение здесь зависит от того, зачем вам сайт, поэтому разберём обе стороны.
Против: ИИ-краулеры создают ощутимую нагрузку; через ИИ-сервисы научились массово парсить контент в обход защит, если боты разрешены; отдельным потоком идут «искатели уязвимостей» — боты, которые с помощью ИИ автоматически проверяют вашу CMS и плагины на дыры, маскируясь под обычный интерес.
За: если ИИ-сервис ссылается на источник, из него приходят живые люди с высоким намерением. Это и есть GEO — оптимизация под ответы нейросетей, о которой мы пишем отдельно. Практический нюанс, который стоит знать заранее: чтобы попадать в ответы ChatGPT, нужно быть видимым в Bing — данные для поиска он берёт оттуда, и запрет краулера тут вторичен.
| Кто | Как разрешить | Стоит ли |
|---|---|---|
| ChatGPT (OpenAI) | Готовая кнопка «Разрешить ChatGPT ботов» в правилах — сама держит списки IP в актуальном виде | Да, если вам нужен трафик из ответов ИИ |
| Gemini, Алиса | Ничего делать не нужно — отдельных разрешений не требуют | Вопрос не возникает |
| Claude, Perplexity и прочие | Вручную: официальные подсети в первую таблицу правил | По ситуации: чистой обратной DNS-записи у большинства нет, проверить их через PTR нельзя |
| Безымянные ИИ-сканеры | Не разрешать | Нет. Это не источник трафика, а разведка уязвимостей |
Хочу трафик из нейросетей, но не хочу отдавать тексты на обучение. Так можно? Частично. Пускаете конкретных ботов, которые дают ссылки, и добавляете в шаблон мета-тег noarchive — он запрещает показ сохранённой копии. Полной защиты от обучения это не даёт: если контент доступен людям, он доступен и обучению. Реалистичная цель — не спрятать текст, а быть тем источником, на который ссылаются.
X-Robots-Tag: noarchive — это не noindex
Самая частая паника вокруг антибота: «скрипт закрыл сайт от индексации, вижу X-Robots-Tag». Не закрыл. Это разные директивы, и путает их одно только внешнее сходство названий.
- noarchive — «не показывай сохранённую копию». Страница индексируется, ранжируется и приносит трафик, из выдачи убирается только ссылка на копию.
- noindex — «не бери страницу в индекс». Вот это и есть исчезновение из поиска.
Антибот штатно умеет отдавать именно noarchive — функция появилась в версии 8.109 ещё в 2022 году. Если сайт действительно пропал из индекса и вы видите noindex — источник другой: SEO-плагин, настройки CMS, случайно оставленный запрет на тестовом окружении. Ищите там, а не в антиботе.
Зачем вообще прятать сохранённую копию? Чтобы парсер не забирал ваш текст из кэша поисковика в обход защиты. Смысл ровно в этом: закрыли дверь на сайте — закройте и запасной вход через сохранённую копию.
Полезные боты, которых нельзя терять
Поисковики — не единственные роботы, которые вам нужны. Агрессивные правила бьют по инфраструктуре, которой вы пользуетесь каждый день и замечаете потерю не сразу.
- PageSpeed Insights и Lighthouse. Отрежете — перестанете измерять скорость и Core Web Vitals; проблема всплывёт, когда просядут позиции.
- Боты предпросмотра ссылок: Telegram, ВКонтакте, соцсети. Отрежете — ваши ссылки в мессенджерах станут голым адресом без картинки и заголовка. Для контентного проекта это прямая потеря переходов.
- RSS-читалки и агрегаторы — если у вас есть подписчики, вы их просто выключите.
- Сервисы мониторинга доступности. Отрежете — узнаете о падении сайта от клиентов, а не от системы.
Список тех, кого стоит пускать, разработчик ведёт отдельной страницей FAQ. Правило простое: включайте правила по одному и после каждого смотрите лог. Пакетное «включить всё сразу» — самый быстрый способ отрезать себе полезное и не понять, какое именно правило виновато.
Когда «капча не грузится» — не ваша вина
Отдельный симптом, который выглядит как ложное срабатывание, но им не является: живой посетитель без VPN видит «Идёт загрузка…» и дальше не проходит, а с VPN всё работает. Хостинг при этом российский, и вчера всё было нормально.
Единой подтверждённой причины у этого симптома нет — это открытый вопрос, а не решённая проблема. Диагностику начинают так: смотрят в консоли браузера, какая именно сетевая ошибка блокирует загрузку скрипта; проверяют, не попал ли под блокировку внешний адрес, к которому идёт проверка; проверяют настройки TLS на сервере. Признак «работает только через VPN» чаще указывает на блокировку внешней инфраструктуры, а не на ошибку настройки — об этом отдельный разбор в статье про облако, РКН и Cloudflare.
Не чините то, что не сломано у вас. Перед тем как перебирать правила и переустанавливать скрипт, проверьте базовое: воспроизводится ли проблема с других устройств и у другого провайдера. Если только у одного — причина на стороне сети посетителя, и правки на сайте её не вылечат.
- Проверка роботов Яндекса — yandex.ru/ips и документация «Как проверить, что робот принадлежит Яндексу»
- Популярные боты, которых можно пустить или не пустить — antibot.cloud/FAQ/good-bots.html
- X-Robots-Tag: NOARCHIVE — для чего нужен — antibot.cloud/FAQ/noarchive.html
- Результат проверки посетителей (причина блокировки) — antibot.cloud/FAQ/result.html
- Описание страницы «Лог запросов» — antibot.cloud/FAQ/hits.html
- Наблюдения по «секретным» подсетям Яндекса и ИИ-ботам — Telegram-канал разработчика «Antibot Cloud News», 2025–2026
Загружаем комментарии…