Анализ терминов контента

Вставьте 3–10 URL конкурентов — страницы, которые ранжируются по нужному вам запросу, — и, по желанию, URL своей страницы или черновик текста. Инструмент загружает каждую страницу, извлекает основной контент, считает термины из одного–трёх слов на выбранном языке и перечисляет термины, встречающиеся минимум в 60 % страниц конкурентов, с числом вхождений на каждой странице и в вашем тексте. Термины, которые вы не используете вовсе, выведены отдельно; рядом — число слов и структура H1–H3. Без скрейпинга выдачи, без «оценки контента» — матрица покрытия, которую можно прочитать и выгрузить в CSV. Ничего не хранится дольше 24 часов.

0 URL — от 3 до 10 за запуск

Сравнивается как загруженная страница, без заголовков. Никогда не сохраняется.

Страницы загружает наш сервер, по одной в секунду на хост; их текст удаляется по окончании сравнения. Хранятся только URL, числа и эта таблица — 24 часа.

Как это работает

1. Страницы конкурентов называете вы (3–10 URL); инструмент не загружает результаты поиска. Наш сервер запрашивает каждую страницу один раз, не чаще одного запроса в секунду на хост, 2 МБ на страницу, 15 с на запрос, до пяти редиректов; ваша страница, указанная по URL, загружается так же — вставленный текст используется как есть
2. Основной контент = элемент <main> или <article>, если он есть, иначе body без навигации, шапки, подвала, aside и форм, со снятыми скриптами и стилями. Число слов и заголовки H1–H3 берутся из этого контента
3. Термины: слова в нижнем регистре, разбитые по небуквенным символам; считаются последовательности из 1, 2 и 3 слов; последовательности, начинающиеся или заканчивающиеся стоп-словом выбранного языка, пропускаются («цена за клик» считается, «за клик» — нет). Японский разбивается по границам письменности, а не морфологическим анализатором — его результаты считайте грубыми
4. Термин попадает в список, если встречается минимум в 60 % прочитанных страниц конкурентов (никогда меньше двух) и минимум дважды в сумме; до 150 терминов, отсортированных по числу страниц, затем по сумме вхождений
5. Отсутствующие = термины из списка с нулём вхождений в вашем тексте. Оценки нет: какие из отсутствующих терминов важны — суждение о теме, а не число

О покрытии терминов и о том, что матрица говорит, а чего нет

Идея покрытия терминов проста: страницы, ранжирующиеся по запросу, обычно охватывают один и тот же набор подтем, а подтемы оставляют след в словаре. Если девять из десяти страниц о бенчмарках email-рассылок упоминают «процент отписок», а ваша нет, вы либо что-то пропустили, либо назвали это иначе. Матрица делает это видимым по терминам и по страницам, чтобы вы решили, что именно. Коммерческие инструменты (Surfer, Clearscope и родственные) считают то же самое, а затем оборачивают в балл и целевое значение; этот инструмент останавливается на подсчёте.

URL конкурентов вы указываете сами. Это ограничение — скрейпер, вытягивающий топ-10, был бы удобнее, — и в этом же суть: вы выбираете действительно сопоставимые страницы (информационную против информационной, товар против товара), а инструменту не нужно скрейпить поисковик, чтобы работать. Три страницы — минимум, чтобы порог 60 % что-то значил; десять — предел, потому что дальше числа по страницам превращаются в шум.

Как читать матрицу: термины, которые есть у всех конкурентов и отсутствуют у вас, — первое, на что смотреть, но они не пробелы автоматически. Термин может быть брендом конкурента, пунктом навигации, переживший чистку шаблона, или мыслью, которую ваш текст выражает другими словами. Помогают числа по страницам — термин, встречающийся 20 раз на одной странице и по разу на остальных, — это навязчивая идея той страницы, а не темы, — и структура H1–H3 показывает, отдельный ли это раздел или мимолётное упоминание.

Число слов показано как медиана, а не как цель. Длинные страницы не лучше; страницы, покрывающие больше из того, о чём запрос, обычно длиннее, а это не одно и то же утверждение. Если ваша страница втрое короче медианы и пропускает половину общих терминов, у двух фактов, вероятно, одна причина. Если она короче и ничего не пропускает — она просто короче.

Частые вопросы

Почему я должен вставлять URL конкурентов сам?
Потому что инструмент не скрейпит результаты поиска — это было бы хрупко, противоречило бы условиям поисковых систем и ставило бы доступность инструмента в зависимость от них. Введите свой запрос в поиск, выберите страницы, которые действительно конкурируют с вашей (то же намерение, тот же тип страницы), и вставьте их. От трёх до десяти.
Где оценка контента?
Её нет. Балл взвешивал бы термины, взвешивание которых никто не обосновал, а целевой балл подталкивал бы текст к переспаму. Матрица показывает, какие термины делят конкуренты и как часто их использует каждая страница; решать, что должна покрывать ваша страница, — редакторская работа, и инструмент не притворяется, что делает её.
Часть терминов в списке — бессмыслица: пункты навигации, cookie-уведомления, бренд конкурента.
Удаление шаблонных блоков эвристическое: <main> и <article>, если есть, иначе вырезаются nav, header, footer и aside. Сайты, которые помещают меню внутрь статьи или повторяют призыв к действию в тексте, пропускают такие термины в список. Игнорируйте их; числа по страницам обычно их выдают (везде по чуть-чуть или много только на одной странице).
Почему страница конкурента помечена как неудачная?
Она вернула статус ошибки, не была HTML, загружалась дольше 15 с или отвергла наш сканер (защита от ботов отвечает 403 или 429 незнакомым user-agent). Неудачные страницы исключаются из порога и подсчётов; сводка говорит, сколько прочитано. Если выпал ключевой конкурент, вставьте его текст как «свой» ввод во втором запуске — чтобы хотя бы увидеть его термины.
Работает ли с языками, кроме английского?
Турецкий, немецкий и русский используют то же разбиение на слова со своими списками стоп-слов; результаты не хуже английских. В японском нет пробелов между словами, и инструмент разбивает текст по смене письменности (кандзи, кана, латиница), а не морфологическим анализатором — фразы получаются грубыми, а числа лишь ориентировочными. Выбирайте язык страниц, а не интерфейса.
Можно ли проверить черновик до публикации?
Да — выберите «Вставить текст» и вставьте черновик. Он сравнивается ровно как загруженная страница, только без заголовков. До 200 000 символов.
Что происходит с загруженными страницами?
Текст используется внутри одной задачи на нашем сервере и удаляется по её окончании; в результате остаются только URL, число слов, заголовки и таблица терминов. Сама задача удаляется через 24 часа. Вставленный вами текст никогда не хранится дольше.
SEO-аудитВведите URL — сканер проверит до 200 страниц так, как это сделал бы первый проход поисковой системы: коды статуса, директивы noindex и canonical, отсутствующие или дублирующиеся title и description, отсутствующие H1, тонкие страницы, изображения без alt, цепочки редиректов, битые ссылки, страницы-сироты, покрытие robots.txt и sitemap. Каждая страница получает те же on-page проверки, что и проверка одной страницы; отчёт группирует их по проблеме и по странице. Без баллов, без выдуманных приоритетов — находки с числами. Скачивание в CSV. Ничего не хранится дольше 24 часов.Проверка on-page SEOВведите URL и, при желании, целевое ключевое слово. Инструмент загружает страницу как Chrome и как Googlebot и сообщает, что говорит сырой HTML: заголовок и meta description с длиной в символах и пикселях, robots meta и X-Robots-Tag, canonical, число H1 и структуру заголовков с пропущенными уровнями, покрытие изображений alt-текстом, внутренние и внешние ссылки и долю nofollow, Open Graph и Twitter card, корректность hreflang, типы JSON-LD, lang, viewport, charset, число слов, плотность и размещение ключевого слова. Без оценки — список того, что пройдено, на что стоит взглянуть и что является лишь справкой. Ничего не сохраняется.Симулятор выдачи Google (SERP)Посмотрите, как ваша страница будет выглядеть в результатах поиска Google, ещё до публикации. Введите title, мета-описание и URL — или загрузите их с реальной страницы — и получите точный до пикселя предпросмотр для десктопа и мобильных, счётчики пикселей и символов, точный символ, на котором Google обрежет текст, и список наблюдений. Бесплатно, без регистрации, ничего не сохраняется.Анализ внутренних ссылокВведите URL — сканер построит граф внутренних ссылок до 200 страниц: сколько страниц ссылается на каждый URL, сколько ссылок отдаёт каждая страница, на сколько кликов каждая страница отстоит от старта и на какие страницы никто не ссылается — сироты, о которых знает только sitemap. Таблица отсортирована по входящим ссылкам, так что страницы, которые ваш собственный сайт считает неважными, оказываются внизу. Скачивание в CSV. Ничего не хранится дольше 24 часов.