Анализ внутренних ссылок
Введите URL — сканер построит граф внутренних ссылок до 200 страниц: сколько страниц ссылается на каждый URL, сколько ссылок отдаёт каждая страница, на сколько кликов каждая страница отстоит от старта и на какие страницы никто не ссылается — сироты, о которых знает только sitemap. Таблица отсортирована по входящим ссылкам, так что страницы, которые ваш собственный сайт считает неважными, оказываются внизу. Скачивание в CSV. Ничего не хранится дольше 24 часов.
Сканирование выполняется на нашем сервере: один запрос в секунду, с соблюдением robots.txt, без JavaScript. Хранятся только стартовый URL и эта сводка — 24 часа.
Как это работает
1. Наш сканер (InsighthackerzBot, один запрос в секунду, без JavaScript) сначала загружает robots.txt и объявленные в нём sitemap, затем начинает с указанного URL и обходит внутренние ссылки в ширину — только тот же хост; www и домен без www считаются одним сайтом 2. Ограничения: 50, 100 или 200 страниц за запуск, 2 МБ на страницу, 15 с на запрос, 5 редиректов на URL; URL, закрытые в вашем robots.txt для нашего user-agent, пропускаются и подсчитываются; страницы с nofollow загружаются, но их ссылки не обходятся 3. Каждая HTML-страница проходит через тот же движок, что и проверка on-page SEO: title, description, H1, canonical, директивы robots, число слов, изображения без alt — предупреждения и ошибки сохраняются по странице, HTML — нет 4. Внутренние ссылки, оказавшиеся битыми при обходе (4xx, 5xx, тайм-ауты), перечисляются вместе со страницами, которые на них ссылаются; внешние ссылки проверяются только HEAD-запросом (один GET, если сервер отвергает HEAD), не более 100 за запуск, ссылки с nofollow исключены 5. Результат — одна задача на нашем сервере: она содержит только стартовый URL и сводку, удаляется через 24 часа и ни для чего другого не используется 6. Входящие ссылки считают различные просканированные страницы, ссылающиеся на URL (страница, ссылающаяся трижды, считается один раз); глубина — кратчайший путь по ссылкам от стартового URL, страницы из sitemap начинают с глубины 1; сирота — просканированная страница с нулём входящих ссылок, кроме стартовой
О внутренних ссылках, глубине кликов и страницах-сиротах
Внутренние ссылки — единственный сигнал ранжирования, полностью находящийся под вашим контролем. Они сообщают сканерам, какие страницы существуют, поисковикам — какие страницы вы считаете важными, и передают тот авторитет, который есть у ссылающейся страницы. Страницу со множеством внутренних ссылок с релевантных страниц легко найти и легко ранжировать; страница без них невидима, пока кто-то не сошлётся на неё извне. Проверка считает входящие ссылки на страницу и сортирует по этому числу, так что внизу таблицы — заброшенные страницы.
Глубина кликов — это число ссылок, по которым посетителю или Googlebot нужно пройти с главной, чтобы попасть на страницу. Глубина 1 — ссылка с главной; глубина 3 и больше — там, где на большинстве сайтов падают частота сканирования и воспринимаемая важность. Глубокие страницы не ошибка, но страница товара или услуги на глубине 4 — обычно проблема навигации, а не контента. Диаграмма распределения показывает форму сайта: широкий плоский сайт и узкий глубокий сканируются очень по-разному.
Страницы-сироты — это страницы, которые обход нашёл (через sitemap или потому что они были целью редиректа стартового URL), но на которые не ссылается ни одна просканированная страница. Они существуют, возможно, даже проиндексированы, но сам сайт на них не указывает. Типичные причины: страницы, убранные из навигации, но не удалённые, посадочные страницы для кампании, старые версии после редизайна. Каждая заслуживает либо ссылки, либо удаления; оставлять её только в sitemap — держать в лимбе, где её находят, но никогда не подтверждают.
Обход в 200 страниц видит маленький сайт целиком, а большой — частично. Числа входящих ссылок при частичном обходе — нижние границы (страницы вне обхода тоже могут ссылаться), а сироты при частичном обходе могут оказаться просто страницами, до чьих ссылающихся страниц обход не дошёл. Читайте числа относительно друг друга и перезапустите с другого стартового URL, если раздел выглядит подозрительно пустым.
Частые вопросы
- Сколько внутренних ссылок должно быть у страницы?
- Числа нет. Google сказал, что больше не применяет старое правило «100 ссылок на страницу», и проверка не задаёт порога. Важно, чтобы у важных страниц было больше входящих ссылок, чем у неважных, и чтобы ничего значимого не стояло на нуле. Используйте отсортированную таблицу, чтобы проверить этот порядок, а не целевое число.
- Что такое страница-сирота?
- Страница, на которую не ссылается ни одна другая просканированная страница. Сканер находит её только потому, что её перечислил sitemap или на неё вёл редирект. Сироты обнаруживаются поздно, сканируются редко и не несут внутреннего авторитета. Либо сошлитесь на них с подходящей страницы, либо, если они устарели, удалите и пусть отдают 404 или редиректят.
- Почему моя главная на глубине 0, а записи блога на глубине 3?
- Глубина — кратчайший путь по ссылкам от стартового URL. Главная → раздел блога → 2-я страница раздела → запись — это три клика. Обычная причина — пагинация; страницы категорий, ссылающиеся на каждую запись напрямую, или блок «последние записи» на главной выводят большинство записей на глубину 2 без нового контента.
- Считает ли проверка навигационные ссылки?
- Да — каждый <a href> в HTML, включая шапку, подвал и боковую панель, по одному разу на ссылающуюся страницу. Ссылки nofollow учитываются в исходящем итоге ссылающейся страницы, но не добавляют цели входящих. Ссылки, вставленные через JavaScript, не видны.
- Почему входящие ссылки отличаются от того, что показывает мой SEO-инструмент?
- Три обычные причины: другой инструмент просканировал больше страниц (этот останавливается на 200), он считает ссылки, а не ссылающиеся страницы (страница с одной и той же ссылкой в шапке и подвале здесь считается один раз), или он рендерит JavaScript и видит ссылки, которых этот сканер не видит. Ни одна из них сильно не меняет порядок страниц относительно друг друга.
- Можно ли просканировать только подпапку?
- Начните с индексной страницы подпапки. Сканер всё равно идёт по ссылкам в любое место того же хоста, так что выйдет из папки, если страницы ссылаются наружу, но глубина будет отсчитываться от вашего стартового URL — при аудите раздела это часто как раз то, что нужно.