SEO-аудит
Введите URL — сканер проверит до 200 страниц так, как это сделал бы первый проход поисковой системы: коды статуса, директивы noindex и canonical, отсутствующие или дублирующиеся title и description, отсутствующие H1, тонкие страницы, изображения без alt, цепочки редиректов, битые ссылки, страницы-сироты, покрытие robots.txt и sitemap. Каждая страница получает те же on-page проверки, что и проверка одной страницы; отчёт группирует их по проблеме и по странице. Без баллов, без выдуманных приоритетов — находки с числами. Скачивание в CSV. Ничего не хранится дольше 24 часов.
Сканирование выполняется на нашем сервере: один запрос в секунду, с соблюдением robots.txt, без JavaScript. Хранятся только стартовый URL и эта сводка — 24 часа.
Как это работает
1. Наш сканер (InsighthackerzBot, один запрос в секунду, без JavaScript) сначала загружает robots.txt и объявленные в нём sitemap, затем начинает с указанного URL и обходит внутренние ссылки в ширину — только тот же хост; www и домен без www считаются одним сайтом 2. Ограничения: 50, 100 или 200 страниц за запуск, 2 МБ на страницу, 15 с на запрос, 5 редиректов на URL; URL, закрытые в вашем robots.txt для нашего user-agent, пропускаются и подсчитываются; страницы с nofollow загружаются, но их ссылки не обходятся 3. Каждая HTML-страница проходит через тот же движок, что и проверка on-page SEO: title, description, H1, canonical, директивы robots, число слов, изображения без alt — предупреждения и ошибки сохраняются по странице, HTML — нет 4. Внутренние ссылки, оказавшиеся битыми при обходе (4xx, 5xx, тайм-ауты), перечисляются вместе со страницами, которые на них ссылаются; внешние ссылки проверяются только HEAD-запросом (один GET, если сервер отвергает HEAD), не более 100 за запуск, ссылки с nofollow исключены 5. Результат — одна задача на нашем сервере: она содержит только стартовый URL и сводку, удаляется через 24 часа и ни для чего другого не используется 6. По странице: предупреждения и ошибки on-page проверки (title, description, H1, canonical, robots, lang, viewport, число слов, изображения, ссылки, социальные теги) плюс HTTP-статус и ошибка загрузки, если была. По сайту: дубли title и description среди индексируемых страниц, цепочки редиректов, страницы-сироты, наличие robots.txt, наличие sitemap и два пробела покрытия 7. Числа считаются только по просканированным страницам; «тонкая» значит меньше 300 слов на индексируемой странице — соглашение, а не правило. Баллов нет: число, взвешивающее отсутствующий alt против noindex, было бы мнением, выданным за измерение
Об аудитах сайта и о том, что показывает этот
Технический SEO-аудит отвечает на три вопроса раньше любых вопросов о контенте: могут ли поисковые системы добраться до страниц, разрешено ли им их индексировать и ясно ли каждая страница говорит, что она такое. Сканер идёт по внутренним ссылкам так же, как обнаружение у Googlebot — тот же хост, соблюдение robots.txt, без JavaScript, — поэтому его находки близки к тому, что находит сканер первого прохода. Страницы, до которых он не добрался, — первая находка; страницы, до которых добрался, но которые велено не индексировать, — вторая; страницы, которые он индексирует с отсутствующим или дублирующимся title, — третья.
Отчёт намеренно плоский. Коммерческие инструменты аудита выдают балл здоровья и раскрашенный список приоритетов; и то и другое — мнения, выданные за измерение, и они подталкивают чинить то, что двигает балл, а не то, что важно для сайта. Здесь каждая проблема — число и список страниц. Отсутствующий meta description на 40 записях блога и noindex на странице цен появятся оба; что срочно — зависит от сайта, а сайт знаете вы.
Проверки по всему сайту — то, чего не может проверка одной страницы. Дубли title между страницами обычно означают шаблон, игнорирующий имя страницы, или серию с пагинацией без номеров страниц. Цепочки редиректов внутри сайта означают, что ссылки ведут на старые URL. Страницы-сироты означают, что sitemap и навигация не согласны. Страницы в обходе, но не в sitemap, и страницы в sitemap, до которых обход не дошёл, показывают два направления этого несогласия. Ничего из этого не видно с одной страницы.
Лимит в 200 страниц делает это выборкой для крупных сайтов. Выборки достаточно, чтобы найти проблемы уровня шаблона — отсутствующий H1 на каждой странице товара виден в первых двадцати, — и недостаточно, чтобы найти один битый URL в каталоге на 5 000 страниц. Начинайте с главной для структуры, с индекса раздела для шаблона этого раздела и читайте числа как «не менее».
Частые вопросы
- Почему нет балла?
- Потому что любой балл — это взвешивание, которое кто-то выбрал. Отсутствующий атрибут alt стоит 1 балл, а noindex на денежной странице — 20? Разные сайты, разные ответы. Отчёт даёт числа и страницы; решать, что чинить первым, — та часть, которая требует знать ваш бизнес, а инструмент его не знает.
- Что аудит не проверяет?
- Всё, что требует браузера: отрендеренный контент, Core Web Vitals, вставленные через JavaScript ссылки или теги, мобильную вёрстку. Всё, что требует внешних данных: обратные ссылки, позиции, частотность запросов. Всё вне сайта: взаимность hreflang между доменами, валидность структурированных данных сверх факта их наличия. Для скорости используйте PageSpeed Insights, для рендеринга — проверку SSR на одной странице.
- Почему страница помечена как тонкая?
- На индексируемой странице насчитано меньше 300 видимых слов. Это соглашение из контентного SEO, а не порог Google; страница контактов на 80 слов — в порядке. Флаг нужен, чтобы находить случайно пустые страницы — шаблон без контента, категорию без товаров, — а не чтобы дотягивать каждую страницу до числа слов.
- Сканер показывает страницы, которые я удалил. Почему?
- Потому что на них всё ещё что-то ссылается: внутренняя навигация, sitemap или цель редиректа. Списки битых ссылок и сирот говорят, что именно. Удалённые страницы должны отдавать 404 или 410 и не иметь ссылок; если они всё ещё в sitemap, это ошибка sitemap.
- У моего сайта есть sitemap, но аудит говорит, что его нет.
- Сканер ищет строки Sitemap: в robots.txt, а если их нет — /sitemap.xml в корне. Sitemap по другому пути, который robots.txt не объявляет, для него невидим — как и для поисковых систем, которым о нём не сообщили в Search Console. Добавьте строку Sitemap: и перезапустите.
- Почему дубли считаются только среди индексируемых страниц?
- Две страницы с одинаковым title, где одна noindex или ссылается canonical на другую, не конкурируют в поиске — в этом смысл директивы. Значимые дубли — между страницами, которые обе претендуют на индексацию. Только их аудит и сравнивает.
- Достаточно ли 200 страниц?
- Для большинства сайтов малого бизнеса — да, они покрывают сайт целиком. Для крупных сайтов это выборка, которая надёжно находит проблемы уровня шаблона и ненадёжно — уровня страницы. Аудит сообщает, когда остановился на лимите. Полный обход большого сайта требует десктопного сканера или платного сервиса.