Проверка robots.txt
Проверьте robots.txt для любого пути и краулера: загрузите файл с сайта или вставьте его, выберите Googlebot, Bingbot, GPTBot, ClaudeBot, PerplexityBot или свой user-agent и увидьте точное правило, которое разрешает или запрещает путь, — плюс сводку по каждому краулеру, предупреждения о синтаксисе и строки Sitemap. Сопоставление по RFC 9309, работает в браузере, ничего не сохраняется.
- 1# Пример — отредактируйте
- 2User-agent: *
- 3Disallow: /admin/
- 4Disallow: /cart
- 5Disallow: /*?sort=
- 6Allow: /admin/help
- 7
- 8User-agent: Googlebot-Image
- 9Disallow: /private-images/
- 10
- 11User-agent: GPTBot
- 12User-agent: CCBot
- 13Disallow: /
- 14
- 15Sitemap: https://www.example.com/sitemap.xml
Подсвечено: группа, которая применяется к этому краулеру; яркая подсветка: правило, принявшее решение.
Кому что доступно
Корень (/) и проверяемый путь /admin/help/getting-started по каждому краулеру — поисковые системы, боты для обучения ИИ, ИИ-поисковики, превью в соцсетях и SEO-инструменты.
| Краулер | Тип | / | Проверяемый путь | Правила из |
|---|---|---|---|---|
| Googlebot | Поиск | Да | Да | User-agent: * |
| Googlebot-Image | Поиск | Да | Да | User-agent: googlebot-image |
| Bingbot | Поиск | Да | Да | User-agent: * |
| Applebot | Поиск | Да | Да | User-agent: * |
| DuckDuckBot | Поиск | Да | Да | User-agent: * |
| YandexBot | Поиск | Да | Да | User-agent: * |
| GPTBot | Обучение ИИ | Нет | Нет | User-agent: gptbot |
| Google-Extended | Обучение ИИ | Да | Да | User-agent: * |
| ClaudeBot | Обучение ИИ | Да | Да | User-agent: * |
| CCBot | Обучение ИИ | Нет | Нет | User-agent: gptbot |
| Bytespider | Обучение ИИ | Да | Да | User-agent: * |
| meta-externalagent | Обучение ИИ | Да | Да | User-agent: * |
| OAI-SearchBot | ИИ-ответы | Да | Да | User-agent: * |
| ChatGPT-User | ИИ-ответы | Да | Да | User-agent: * |
| PerplexityBot | ИИ-ответы | Да | Да | User-agent: * |
| Claude-Web | ИИ-ответы | Да | Да | User-agent: * |
| Amazonbot | ИИ-ответы | Да | Да | User-agent: * |
| facebookexternalhit | Превью в соцсетях | Да | Да | User-agent: * |
| AhrefsBot | SEO-инструмент | Да | Да | User-agent: * |
| SemrushBot | SEO-инструмент | Да | Да | User-agent: * |
Синтаксис и семантика (0)
Предупреждений нет — каждая строка является директивой, понятной краулерам.
Sitemap (1)
https://www.example.com/sitemap.xml
Разбор и сопоставление выполняются в вашем браузере по RFC 9309 и задокументированному поведению Google. Единственный запрос к серверу — необязательная загрузка /robots.txt, которая ничего не сохраняет. Правило robots.txt — просьба, а не контроль доступа: добропорядочные краулеры соблюдают его, остальные — нет.
Как это работает
1. Загружается robots.txt — с хоста сайта (/robots.txt, не более 512 КБ, редиректы выполняются) или из вставленного текста; отсутствующий файл (4xx) означает «разрешено всё», ошибка сервера (5xx) — Google не сканирует ничего, пока сервер не восстановится 2. Файл разбирается на группы: каждая серия строк User-agent открывает группу с последующими правилами Allow и Disallow; строки Sitemap глобальны; неизвестные директивы сохраняются и помечаются 3. Выбирается группа для краулера: наиболее специфичный токен User-agent, совпадающий с токеном продукта краулера (без учёта регистра, например Googlebot-Image приоритетнее Googlebot); только если совпадений нет — группа User-agent: *; если нет ни того ни другого, разрешено всё 4. Путь сопоставляется с каждым правилом группы — * соответствует любым символам, $ закрепляет конец, иначе действует сопоставление по префиксу с percent-нормализованным путём и строкой запроса 5. Решает правило с самым длинным совпавшим шаблоном; при равной длине побеждает Allow; нет совпадений — разрешено 6. То же повторяется для 20 известных краулеров (поиск, обучение ИИ, ИИ-поисковики, превью в соцсетях, SEO-инструменты) по корню и проверяемому пути, затем выводятся предупреждения о синтаксисе и строки Sitemap
О robots.txt и о том, как его читают краулеры
robots.txt — это обычный текстовый файл в корне хоста, который сообщает краулерам, какие пути им можно запрашивать. Это просьба, а не замок: корректные краулеры — все крупные поисковые системы и те ИИ-боты, что публикуют свой user-agent, — читают его перед сканированием, но ничто не мешает краулеру, который его игнорирует. Правила влияют только на сканирование, а не на индексацию: заблокированная страница всё равно может появиться в выдаче, если на неё ведут ссылки с других страниц, — просто без описания. Чтобы убрать страницу из индекса, она должна быть доступна для сканирования и содержать тег noindex.
Правила сопоставления точны и в основном понимаются неверно. Краулер использует ровно одну группу: ту, чей токен User-agent совпадает с ним наиболее специфично, либо группу * — никогда обе сразу. Внутри группы побеждает самый длинный совпавший шаблон пути независимо от порядка строк, а если Allow и Disallow совпадают с одинаковой длиной, побеждает Allow. * соответствует любой последовательности символов, $ закрепляет шаблон за концом пути; без $ каждое правило — префикс. Этот инструмент реализует правила так, как их описывают RFC 9309 и документация Google, и показывает строку, принявшую решение, а не только вердикт.
Сводка по краулерам существует потому, что robots.txt стал тем местом, где сайты решают, кто может использовать их контент для ИИ. GPTBot, ClaudeBot, CCBot, Google-Extended, Bytespider и meta-externalagent собирают данные для обучения; OAI-SearchBot, ChatGPT-User, PerplexityBot и Claude-Web запрашивают страницы для ответов на вопросы и могут приводить трафик; Googlebot и Bingbot индексируют для поиска. Одна строка Disallow: / под User-agent: * блокирует их всех сразу, включая тех, кто приводит посетителей. Таблица показывает, что каждый названный бот сделает с файлом в его текущем виде, — так компромисс становится видимым, а не случайным.
Предупреждения охватывают ошибки, которые незаметно меняют поведение: правило до первой строки User-agent (игнорируется), пустой Disallow (разрешает всё), путь без ведущего слеша, относительный URL в Sitemap, Crawl-delay (который Google и Bing игнорируют), директива Noindex (не поддерживается с 2019 года), повторная группа, маркер порядка байтов и файл больше того объёма, который читает Google. Ничего из этого не является советом, что именно блокировать, — это зависит от сайта; речь только о том, говорит ли файл то, что имел в виду его автор.
Частые вопросы
- Удаляет ли Disallow в robots.txt страницу из Google?
- Нет. Он запрещает Googlebot запрашивать страницу, но URL всё равно может попасть в индекс по ссылкам с других сайтов и показываться без сниппета. Чтобы удалить страницу из индекса или не пустить её туда, разрешите сканирование и добавьте метатег robots noindex или заголовок X-Robots-Tag. Блокировать страницу в robots.txt и одновременно ставить noindex не работает: noindex никто не увидит.
- Какое правило побеждает, если совпадают и Allow, и Disallow?
- То, у которого шаблон пути длиннее. Disallow: /admin/ и Allow: /admin/help оба совпадают с /admin/help/start; шаблон Allow длиннее, поэтому путь разрешён. Если два шаблона в точности одной длины, побеждает Allow. Порядок строк значения не имеет.
- Применяется ли группа User-agent: * и к Googlebot?
- Только если нет группы, в которой назван Googlebot. Краулер следует ровно одной группе — наиболее специфичному совпадению для своего токена, иначе *. Правила никогда не объединяются между группами, поэтому сайт с группой Googlebot без строк Disallow разрешает Googlebot сканировать всё, что блокирует группа *.
- Как заблокировать ИИ-ботов, не блокируя поисковые системы?
- Дайте каждому ИИ-краулеру свою группу или перечислите несколько токенов в одной: User-agent: GPTBot, User-agent: CCBot, затем Disallow: /. Группу * и группы Googlebot или Bingbot оставьте как есть. Сводная таблица показывает, какие названные боты оказались заблокированы и каких поисковых краулеров это не коснулось. Учтите: Google-Extended управляет использованием контента для обучения Gemini, но не сканированием Googlebot.
- Почему инструмент говорит, что файл разрешает всё, хотя в нём есть строки Disallow?
- Чаще всего потому, что строки Disallow стоят до первой строки User-agent, или потому, что у выбранного краулера есть своя группа без этих правил. Подсветка строк показывает, какая группа применилась; список предупреждений помечает правила, не принадлежащие ни одной группе.
- Поддерживается ли Crawl-delay?
- Google и Bing — нет: Google игнорирует директиву полностью, а Bing предпочитает настройку частоты сканирования в Webmaster Tools. Некоторые менее крупные краулеры её учитывают. Инструмент разбирает директиву и помечает её, чтобы вы знали: для двух крупнейших поисковых систем она не делает того, чего вы, возможно, ожидаете.
- Что происходит, когда robots.txt возвращает ошибку?
- 404 или другой код 4xx означает, что robots.txt нет, и краулеры считают, что разрешено всё. 5xx или тайм-аут Google трактует как временный полный запрет: он прекращает сканирование и может держать это состояние до 30 дней, прежде чем счесть, что правил нет. Редирект на другой хост выполняется, но правила применяются к исходному хосту, только если файл найден.