Анализ терминов контента
Вставьте 3–10 URL конкурентов — страницы, которые ранжируются по нужному вам запросу, — и, по желанию, URL своей страницы или черновик текста. Инструмент загружает каждую страницу, извлекает основной контент, считает термины из одного–трёх слов на выбранном языке и перечисляет термины, встречающиеся минимум в 60 % страниц конкурентов, с числом вхождений на каждой странице и в вашем тексте. Термины, которые вы не используете вовсе, выведены отдельно; рядом — число слов и структура H1–H3. Без скрейпинга выдачи, без «оценки контента» — матрица покрытия, которую можно прочитать и выгрузить в CSV. Ничего не хранится дольше 24 часов.
Страницы загружает наш сервер, по одной в секунду на хост; их текст удаляется по окончании сравнения. Хранятся только URL, числа и эта таблица — 24 часа.
Как это работает
1. Страницы конкурентов называете вы (3–10 URL); инструмент не загружает результаты поиска. Наш сервер запрашивает каждую страницу один раз, не чаще одного запроса в секунду на хост, 2 МБ на страницу, 15 с на запрос, до пяти редиректов; ваша страница, указанная по URL, загружается так же — вставленный текст используется как есть 2. Основной контент = элемент <main> или <article>, если он есть, иначе body без навигации, шапки, подвала, aside и форм, со снятыми скриптами и стилями. Число слов и заголовки H1–H3 берутся из этого контента 3. Термины: слова в нижнем регистре, разбитые по небуквенным символам; считаются последовательности из 1, 2 и 3 слов; последовательности, начинающиеся или заканчивающиеся стоп-словом выбранного языка, пропускаются («цена за клик» считается, «за клик» — нет). Японский разбивается по границам письменности, а не морфологическим анализатором — его результаты считайте грубыми 4. Термин попадает в список, если встречается минимум в 60 % прочитанных страниц конкурентов (никогда меньше двух) и минимум дважды в сумме; до 150 терминов, отсортированных по числу страниц, затем по сумме вхождений 5. Отсутствующие = термины из списка с нулём вхождений в вашем тексте. Оценки нет: какие из отсутствующих терминов важны — суждение о теме, а не число
О покрытии терминов и о том, что матрица говорит, а чего нет
Идея покрытия терминов проста: страницы, ранжирующиеся по запросу, обычно охватывают один и тот же набор подтем, а подтемы оставляют след в словаре. Если девять из десяти страниц о бенчмарках email-рассылок упоминают «процент отписок», а ваша нет, вы либо что-то пропустили, либо назвали это иначе. Матрица делает это видимым по терминам и по страницам, чтобы вы решили, что именно. Коммерческие инструменты (Surfer, Clearscope и родственные) считают то же самое, а затем оборачивают в балл и целевое значение; этот инструмент останавливается на подсчёте.
URL конкурентов вы указываете сами. Это ограничение — скрейпер, вытягивающий топ-10, был бы удобнее, — и в этом же суть: вы выбираете действительно сопоставимые страницы (информационную против информационной, товар против товара), а инструменту не нужно скрейпить поисковик, чтобы работать. Три страницы — минимум, чтобы порог 60 % что-то значил; десять — предел, потому что дальше числа по страницам превращаются в шум.
Как читать матрицу: термины, которые есть у всех конкурентов и отсутствуют у вас, — первое, на что смотреть, но они не пробелы автоматически. Термин может быть брендом конкурента, пунктом навигации, переживший чистку шаблона, или мыслью, которую ваш текст выражает другими словами. Помогают числа по страницам — термин, встречающийся 20 раз на одной странице и по разу на остальных, — это навязчивая идея той страницы, а не темы, — и структура H1–H3 показывает, отдельный ли это раздел или мимолётное упоминание.
Число слов показано как медиана, а не как цель. Длинные страницы не лучше; страницы, покрывающие больше из того, о чём запрос, обычно длиннее, а это не одно и то же утверждение. Если ваша страница втрое короче медианы и пропускает половину общих терминов, у двух фактов, вероятно, одна причина. Если она короче и ничего не пропускает — она просто короче.
Частые вопросы
- Почему я должен вставлять URL конкурентов сам?
- Потому что инструмент не скрейпит результаты поиска — это было бы хрупко, противоречило бы условиям поисковых систем и ставило бы доступность инструмента в зависимость от них. Введите свой запрос в поиск, выберите страницы, которые действительно конкурируют с вашей (то же намерение, тот же тип страницы), и вставьте их. От трёх до десяти.
- Где оценка контента?
- Её нет. Балл взвешивал бы термины, взвешивание которых никто не обосновал, а целевой балл подталкивал бы текст к переспаму. Матрица показывает, какие термины делят конкуренты и как часто их использует каждая страница; решать, что должна покрывать ваша страница, — редакторская работа, и инструмент не притворяется, что делает её.
- Часть терминов в списке — бессмыслица: пункты навигации, cookie-уведомления, бренд конкурента.
- Удаление шаблонных блоков эвристическое: <main> и <article>, если есть, иначе вырезаются nav, header, footer и aside. Сайты, которые помещают меню внутрь статьи или повторяют призыв к действию в тексте, пропускают такие термины в список. Игнорируйте их; числа по страницам обычно их выдают (везде по чуть-чуть или много только на одной странице).
- Почему страница конкурента помечена как неудачная?
- Она вернула статус ошибки, не была HTML, загружалась дольше 15 с или отвергла наш сканер (защита от ботов отвечает 403 или 429 незнакомым user-agent). Неудачные страницы исключаются из порога и подсчётов; сводка говорит, сколько прочитано. Если выпал ключевой конкурент, вставьте его текст как «свой» ввод во втором запуске — чтобы хотя бы увидеть его термины.
- Работает ли с языками, кроме английского?
- Турецкий, немецкий и русский используют то же разбиение на слова со своими списками стоп-слов; результаты не хуже английских. В японском нет пробелов между словами, и инструмент разбивает текст по смене письменности (кандзи, кана, латиница), а не морфологическим анализатором — фразы получаются грубыми, а числа лишь ориентировочными. Выбирайте язык страниц, а не интерфейса.
- Можно ли проверить черновик до публикации?
- Да — выберите «Вставить текст» и вставьте черновик. Он сравнивается ровно как загруженная страница, только без заголовков. До 200 000 символов.
- Что происходит с загруженными страницами?
- Текст используется внутри одной задачи на нашем сервере и удаляется по её окончании; в результате остаются только URL, число слов, заголовки и таблица терминов. Сама задача удаляется через 24 часа. Вставленный вами текст никогда не хранится дольше.