コンテンツ用語分析
競合URLを3〜10件貼り付け — 対象クエリで上位表示されているページ — 、任意で自分のページのURLまたは下書きテキストを追加します。ツールは各ページを取得し、本文を抽出し、選んだ言語で1〜3語の用語を数え、競合ページの60%以上に出現する用語をページごとの出現数と自分の出現数とともに一覧化します。自分がまったく使っていない用語は別に一覧化し、語数とH1〜H3の見出し構成も並べて表示します。検索結果のスクレイピングなし、コンテンツスコアなし — 読んでCSVに書き出せるカバレッジマトリクスです。24時間を超えて保存されるものはありません。
ページは当社サーバーがホストごとに1秒に1件取得し、テキストは比較終了時に破棄されます。保持するのはURL、件数、この表のみで、24時間後に削除されます。
仕組み
1. 競合ページは自分で指定します(3〜10 URL)。ツールは検索結果を取得しません。当社サーバーが各ページを1回リクエストし、ホストごとに最大1秒1リクエスト、1ページ2 MB、1リクエスト15秒、リダイレクトは最大5回。URLで指定した自分のページも同じ方法で取得し、貼り付けたテキストはそのまま使います 2. 本文 = ページに <main> または <article> があればその要素、なければナビゲーション・header・footer・aside・フォームを除き、script と style を取り除いた body。語数と H1〜H3 見出しはその本文から取ります 3. 用語: 単語を小文字化して非文字で分割し、1・2・3語の並びを数えます。選んだ言語のストップワードで始まるか終わる並びはスキップします('cost per click' は数え、'of click' は数えない)。日本語は形態素解析ではなく文字種の境界で分割します — 結果は粗いものとして扱ってください 4. 読み込めた競合ページの60%以上(2ページ未満にはならない)かつ合計2回以上出現した用語を掲載。最大150件、ページ数、次に合計出現数の順 5. 不足 = 自分のテキストで出現数がゼロの掲載用語。スコアはありません: 不足用語のどれが重要かはトピックについての判断であり、数ではありません
用語カバレッジについて、マトリクスが示すことと示さないこと
用語カバレッジの考え方は単純です: あるクエリで上位表示されるページは同じサブトピック群を扱う傾向があり、サブトピックは語彙に痕跡を残します。メールのベンチマークに関する10ページ中9ページが「配信停止率」に触れていて自分のページが触れていなければ、何かを省いたか、別の呼び方をしているかのどちらかです。マトリクスはそれを用語ごと・ページごとに可視化し、どちらなのかはあなたが判断します。商用ツール(Surfer、Clearscope とその同類)は同じ集計をしてからスコアと目標で包みますが、このツールは集計で止まります。
競合URLは自分で用意します。これは制約であり — 上位10件を取ってくるスクレイパーの方が便利でしょう — 同時に要点でもあります: 本当に比較可能なページ(情報ページ対情報ページ、商品対商品)をあなたが選び、ツールは動くために検索エンジンをスクレイピングする必要がありません。60%のしきい値に意味を持たせるには最低3ページ、上限は10ページで、それ以上はページごとの数がノイズになります。
マトリクスの読み方: すべての競合にあって自分にない用語が最初に見るべきものですが、自動的にギャップというわけではありません。競合のブランド名、定型文除去をすり抜けたナビゲーションのラベル、あなたのテキストが別の言葉で表現している概念かもしれません。ページごとの数が助けになります — 1ページに20回、他には1回ずつ出る用語はそのページの執着であってトピックのものではありません — そしてH1〜H3の構成は、その用語が独立した節なのか通りすがりの言及なのかを示します。
語数は目標ではなく中央値として表示します。長いページが良いわけではありません。クエリの主題をより多く扱うページは長くなる傾向がある、というのは同じ主張ではありません。自分のページが中央値の3分の1で共通用語の半分を欠いているなら、2つの事実はおそらく同じ原因です。短いのに何も欠けていないなら、単に短いだけです。
よくある質問
- なぜ競合URLを自分で貼り付けなければならないのですか?
- ツールが検索結果をスクレイピングしないからです — それは壊れやすく、検索エンジンの規約に反し、ツールの可用性を検索エンジン次第にしてしまいます。クエリで検索し、自分のページと本当に競合しているページ(同じ意図、同じ種類のページ)を選んで貼り付けてください。3〜10件です。
- コンテンツスコアはどこにありますか?
- ありません。スコアは誰も正当化していない重み付けで用語を評価することになり、目標スコアはテキストを詰め込みへ押しやります。マトリクスは競合が共有する用語と各ページの使用頻度を示します。自分のページが何を扱うべきかを決めるのは編集の仕事で、ツールはそれをするふりをしません。
- 一覧の用語に意味のないものがあります — ナビゲーションのラベル、Cookie通知、競合のブランド名など。
- 定型文の除去はヒューリスティックです: <main> と <article> があればそれを使い、なければ nav、header、footer、aside を除きます。メニューを記事内に置くサイトや、本文でCTAを繰り返すサイトでは、そうした用語が一覧に漏れ込みます。無視してください。ページごとの数で通常は見分けがつきます(全ページに少数ずつ、または1ページだけに多数)。
- 競合ページが失敗と表示されるのはなぜですか?
- エラーステータスを返した、HTMLではなかった、15秒以上かかった、または当社クローラーを拒否した(ボット対策は未知のUAに 403 か 429 を返します)ためです。失敗したページはしきい値と集計から除外され、要約に何ページ読めたかが表示されます。重要な競合が失敗した場合は、2回目の実行でそのテキストを「自分」の入力として貼り付ければ、少なくともその用語は確認できます。
- 英語以外の言語にも対応していますか?
- トルコ語、ドイツ語、ロシア語は同じ単語分割にそれぞれのストップワードリストを使い、結果は英語と同程度です。日本語には単語間の空白がなく、ツールは形態素解析ではなく文字種の切り替わり(漢字の連続、かなの連続、ラテン文字の連続)で分割します — フレーズは粗く、数は目安に過ぎません。インターフェースではなくページの言語を選んでください。
- 公開前の下書きに使えますか?
- はい — 「テキストを貼り付け」を選んで下書きを貼り付けてください。取得したページとまったく同じように比較されます(見出しは除く)。最大200,000文字です。
- 取得したページはどうなりますか?
- テキストは当社サーバー上の1つのジョブ内で使われ、ジョブ終了時に破棄されます。結果に残るのはURL、語数、見出し、用語テーブルだけです。ジョブ自体は24時間後に削除されます。貼り付けたテキストがそれ以上保存されることはありません。