測定方法
AI検索での可視性をどう測定するか
スコアの意味、算出方法、そして何より、スコアが伝えられないことについての、誠実で公開された説明です。私たちの測定方法は、最も誇りに思っている部分であり、公開されるべきものです。
最終更新:2026年6月 · この分野は変化が速いため、主要な統計は四半期ごとに再検証しています。
測定対象
WhoCanFindMeは2つの異なるものを測定しています。どちらも理解しておくことが重要です。
- AI対応度(無料監査)。 あなたの公開ページから直接抽出したシグナル、robots.txtのルール、構造化データ、コンテンツの抽出可能性、鮮度シグナル、技術的健全性に基づく、決定論的でヒューリスティックなスコアです。ライブのAI APIを呼び出す必要がないため、数秒で完了し、費用もかかりません。あなたのページがAIクローラーやパーサーに見つけてもらえる位置にあるかどうかを示します。
- 実測可視性(有料プラン)。 ChatGPT、Perplexity、Geminiにライブのグラウンディングクエリを送信し、さらに(ネイティブのウェブ検索APIをまだ持たない)Claudeには学習データ想起クエリを送信して、あなたのブランドが実際に回答内に登場しているかを測定します。3つのエンジンは検索ベースであり、Claudeは学習データの記憶を確認するものです。詳細はセクション4をご覧ください。
この違いは重要です。対応度スコアはAI可視性のための技術的な前提条件を示し、実測可視性は実際の結果を示します。対応度を「ドアの鍵が開いているか」、実測可視性を「実際に人がそこを通り抜けているか」と考えるとわかりやすいでしょう。
対応度を測る6つのシグナル
対応度スコアは、6つのシグナルカテゴリーを集約したものです。それぞれは、AI APIを呼び出すことなく、あなたの公開ページから独立して測定できます。
AIクローラーアクセス
高内容: 主要なAIクローラーがそもそもあなたのコンテンツにたどり着けるかどうか。
測定方法: GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot、Google-Extendedを対象とした明示的なDisallowルールが、robots.txtに存在しないかを解析します。クローラーがブロックされている場合、そのエンジンはページをインデックスできず、コンテンツの質にかかわらず引用の対象から完全に除外されます。
根拠: 共通認識:クローラーアクセスは二値のゲートです。ChatGPTの引用の87%はBingの上位10件の検索結果と一致しており(Seer Interactive、2025年)、OAI-SearchBotのアクセスを必要とするBingへのインデックスは、ChatGPTの可視性にとって最も重要な単一シグナルです。
構造化データ
Geminiでは高、他は中内容: AIエンジンがあなたのコンテンツを構造化された事実として解析できるようにする、JSON-LDのスキーママークアップ。
測定方法: ページのJSON-LDブロックをスキャンし、FAQPage、Article、HowTo、Organization、BreadcrumbListの各タイプを確認します。FAQPageは最優先のタイプです。1,508件の不動産サイトを対象にした2026年の調査では、ChatGPTに表示されるサイトの6.2%にFAQPageスキーマが存在していたのに対し、表示されないサイトではわずか0.8%でした。
根拠: 有力:対照研究(Schanbacher、2026年、n=1,508)。他のスキーマタイプについては、独立した研究間で相関が一定しないか、まったく見られないため、スキーマを万能薬のように過信しないでください。
抽出可能性
Claudeでは最高、他は高内容: AIがあなたのページから最も関連性の高い箇所を見つけ出し、引用できる度合い。
測定方法: 回答ファーストの構成(冒頭約200語以内での直接的な回答)、見出しの数、FAQ形式のQ&Aペア、リストや表、そしてFlesch読みやすさスコアを確認します。冒頭でクエリに答えているページは、コンテンツの最初の3分の1から引用される割合が44%に達します(実務者による調査)。AIの引用にはFleschスコア50から70の範囲の読みやすさが最適です。
根拠: 有力:実務者間の共通認識に加え、コンテンツ構成のシグナルが引用増加と相関するというPrinceton GEO paperの知見によります(n=10,000クエリ、Perplexity)。
権威性と事実密度
Perplexityでは最高、Geminiでは高内容: 事実に基づくコンテンツを通じて、ページ自体がどれだけ信頼性を伝えられているか。
測定方法: 統計データやパーセンテージの数(Princeton GEO paperによれば、数値を伴う主張は引用確率を約41%高めます)、権威あるドメインへの外部リンク、本文中の引用、そして全体の文字数(コンテンツの深さの目安)をカウントします。これらはE-E-A-Tシグナルの代理指標であり、Google AI Overviewsの引用の96%に見られます。
根拠: 実証済み:Princeton GEO paper(統計:+41%、引用:+34%、n=10,000クエリ)。E-E-A-Tとの相関はWellows study(実務者調査、2025年)による。AIOとのブランド言及の相関:r=0.664、これはページ自体から測定できる指標の中で最も強力な予測因子です。
鮮度
Perplexityでは最高内容: あなたのページが、情報がどれだけ新しいかをAIエンジンに伝えているかどうか。
測定方法: JSON-LD内のdatePublishedとdateModified、サイトマップのlastmod、HTMLのメタ日付タグを確認します。最新のシグナルが何日前のものかを算出します。Perplexityの検索パイプラインは新しさに関して厳格なフィルターを適用しており、鮮度シグナルのないページは古くなっている可能性があるとみなされます。
根拠: 共通認識:Perplexityは鮮度をランキング要因として明示的に文書化しています。鮮度シグナル単体による引用増加を定量的に切り分けた研究はありませんが、実務者の間での見解は強く一致しています。
技術的健全性
ChatGPTでは高、他は中内容: AIクローラーがそのページを実際に取得・解析できるかどうか。
測定方法: HTTPS、有効なHTTP 200ステータス、viewportメタタグ(モバイル対応の目安)、そしてページがJavaScriptレンダリングに大きく依存していないかを確認します。AIクローラーは通常、JavaScriptを実行せずに生のHTMLを取得するため、JavaScriptへの依存度が高いページはほぼ空白のように見えてしまうことがあります。
根拠: HTTPSとJavaScriptレンダリングについては共通認識があります。ページ速度の影響については、ある実務者調査で、FCPが0.4秒未満のページはChatGPTの引用を6.7件獲得したのに対し、FCPが1.13秒を超えるページは2.1件にとどまりました。ただしこれは独立した研究で再現されておらず、参考程度にとどめるべきです。
llms.txtについての補足
/llms.txtファイルが存在しないことは、重大ではなく情報提供のための指摘としてフラグを立てています。現時点の証拠はその重要性を否定するものです。137,000ドメインを対象にしたAhrefsの2026年5月の調査では、llms.txtファイルの97%がどのAIボットからのトラフィックも受け取っていませんでした。この仕様が今後普及する可能性があるためシグナルとしては含めていますが、現時点での効果を過大に伝えることはしません。
エンジン別スコアリング
各AIエンジンは検索アーキテクチャが実際に異なるため、6つのシグナルカテゴリーへの重み付けもそれぞれ異なります。単一の「AIスコア」を示すのではなく、エンジンごとに対応度スコアを算出し、それらを平均して全体の指標を出しています。
| シグナル | ChatGPT | Perplexity | Gemini | Claude |
|---|---|---|---|---|
| クローラーアクセス | 25% | 20% | 20% | 20% |
| 構造化データ | 15% | 10% | 25% | 20% |
| 抽出可能性 | 20% | 15% | 15% | 30% |
| 権威性 | 15% | 25% | 20% | 15% |
| 鮮度 | 10% | 25% | 10% | 5% |
| 技術 | 15% | 5% | 10% | 10% |
ChatGPTは、引用の87%がBingの上位10件から来ており、BingはOAI-SearchBotへのアクセスを必要とするため、クローラーアクセスを重視します。Perplexityは、6段階のRAGパイプラインが新しさと事実密度を厳しくフィルタリングするため、鮮度と権威性を最も重視します。Geminiは、GoogleのE-E-A-Tの枠組みを反映し、構造化データと権威性シグナルを最も重視します。Claudeは最も選別が厳しいエンジンであり、引用の97.8%が確立された、明確に構造化された情報源から来ているため、抽出可能性を最優先します。
robots.txtでブロックされているエンジンは、統合スコアに55%のペナルティを受けます(スコアに0.45を掛けます)。これは、ブロックされたエンジンがページをまったくインデックスも引用もできないことを反映しています。
総合対応度スコアは、それぞれ[0, 100]の範囲に収められた4つのエンジン別スコアの算術平均です。
実測可視性(ライブのグラウンディングクエリ)
対応度スコアは、AI可視性にとって必要ではあっても十分な条件ではありません。実測可視性はさらに一歩進み、実際のAIエンジンに実際のクエリを送信し、あなたのブランドがグラウンディングされた引用付きの回答に登場するかどうかを測定します。
なぜ学習データへの問いかけではなく、グラウンディングクエリなのか
主要な消費者向けAIエンジンの多く(ChatGPT Search、Perplexity、Google AI Overviews、Copilot)では、回答はクエリの時点でのライブのウェブ検索にグラウンディングされています。学習データの記憶は、AIがあるブランドの存在を「知っている」かどうかを決めますが、ライブ検索は、AIが回答の中でそのブランドを引用するかどうかを決めます。GEOは本質的に検索の問題であり、だからこそエンジンが対応している限り、私たちはグラウンディングクエリを優先します。
ChatGPT、Perplexity、Geminiについては、ベースモデルへのプロンプト(ウェブ検索を使わずにAIにブランドについて「知っていること」を尋ねる方法)を使用しません。この方法は固定された学習データの記憶を試すものであり、非決定性が非常に高く、知名度の低いブランドではハルシネーションが起きやすく、グラウンディングされた消費者向けエンジンでユーザーが実際に目にするものを反映しません。Claudeだけは例外です。現行のAnthropic APIには、OpenAIやGoogleのものに相当するネイティブのウェブ検索ツールがまだ存在しないため、そのスコアは必然的にグラウンディングされた測定ではなく、学習データ想起の確認となります。この点はClaudeのすべてのスコアに明記しており、Anthropicがウェブ検索APIを提供次第、グラウンディングクエリに切り替えます。
クエリセットの設計
3つのカテゴリーをカバーする厳選されたクエリセットを構築します。発見クエリ(カテゴリーベースで、ブランド名を含まない)、比較クエリ(評価段階)、そしてブランド指定クエリです。比率はおおよそ60/30/10で、新しい見込み客を獲得できる発見クエリに最も重みを置いています。監査あたり最低30件のクエリで意味のあるシグナルが得られ、標準の完全な監査では50件を使用します。
反復実行と統計的な扱い
1つのクエリを1回だけ実行しても、ほとんど意味がありません。LLMの非決定性により、同じクエリでも実行のたびに異なる引用結果が生じることがあり、これはtemperature=0であっても同様です(GPUレベルでのバッチサイズのばらつきは排除できません)。Princeton GEO paperによれば、可視性の割合を安定させるには60から100回の反復が必要です。
各反復では、まったく同じクエリを再送信します。反復のあいだにプロンプトを変えたり言い換えたりすることはありません。標準の有料監査ではエンジンごと・クエリごとに3回の反復を実行し、無料/匿名プレビューおよびAgencyの定期再実行では1回のみ(単一サンプルのスナップショットで、区間なし)です。引用率は、ブランドが引用された実行の割合として算出されます(brandCited = true)。この割合の95%信頼区間の算出には、Wilsonスコア区間を使用します。これは、同一の呼び出しに対するプロバイダー側のばらつきのもとでの実行間の一貫性を反映するものであり、同じクエリの異なる言い回しによって引用がどう変わるかのサンプルではありません。
APIと消費者向けUIの再現度
ChatGPT、Perplexity、Geminiについては、各エンジンのプログラム用APIをウェブ検索を有効にした状態で使用します。これは業界標準であり、唯一スケール可能な方法ですが、既知のギャップも生じます。
- 消費者向けのChatGPT.comには、APIでは再現できないパーソナライズや閲覧履歴が反映されている場合があります。
- Google Searchグラウンディングを使用したGemini APIと、Google AI Overviewsとでは、上位引用ドメインの重なりが約38.5%にとどまります。これは構造的なギャップであり、Googleのすべてのスコアで明示的に開示しています。
- Perplexityは、APIと消費者向けUIのあいだに乖離が生じうることを文書化しています。
- ClaudeのAPIにはウェブ検索ツールが一切ないため、そのスコアはライブAPI呼び出しの代わりにモデルの学習データ想起を使用します。これは4エンジンの中で最も大きな再現度のギャップであり、Claudeのすべてのスコアで開示しています。
実測可視性スコアを含むすべてのレポートで、これらの限界を明示しています。測定の限界について透明であることは、見せかけの精度よりも価値があると私たちは考えています。
信頼区間とばらつき
AI可視性スコアは推定値であり、事実そのものではありません。どの測定にも、ばらつきを生む3つの要因が影響します。
- LLMの非決定性。 temperature=0であっても、GPUレベルのバッチサイズのばらつきによりAPIの応答は変動します。反復なしの一時点のスコアは、再実行すると±30%変動することがあります。私たちの実測可視性エンジンは、同一のクエリを複数回繰り返し実行し、得られた引用率についてWilsonスコアの信頼区間を報告します。これは、同じクエリの異なる言い回しによる変動ではなく、プロバイダー側のばらつきのもとでの実行間の一貫性を測定するものであり、各数値がどれだけ安定しているかがわかります。
- モデルとアルゴリズムの更新。 OpenAI、Google、Perplexityは、公表なしに継続的にモデルを更新することがよくあります。6週間前のスコアは、現在の実態を反映していない可能性があります。すべてのスコアに測定日を表示し、30日を超えて経過したスコアにはフラグを立てています。
- 地域とパーソナライズによる差。 同じクエリでも、地域、言語、アカウントの種類によって異なる回答が返されます。私たちの測定は標準化された場所から実行しています。他の地域では結果が異なる場合があります。
対応度スコア(無料監査)は、確率的なAIの出力ではなく決定論的なシグナル(robots.txt、構造化データ、HTMLコンテンツ)を検証するため、実測可視性よりもはるかに安定しています。対応度スコアの変化は、あなたのページに実際に起きた変化を反映しています。
このツールが伝えること、伝えないこと
測定の限界について知的に誠実であることこそが、役立つツールと、それらしく見えるだけのスコア生成器を分けると私たちは考えています。このツールが明確に伝えられないことは、以下の通りです。
AIからのオーガニックトラフィックは測定していません。
AIによる引用と、AI経由の紹介トラフィックは別のものです。AIプラットフォームは外部へのクリックを発生させずにUI内で回答を完結させることが増えているため(Digiday、2025年)、あるブランドが頻繁に引用されていても、紹介トラフィックが横ばいのままということがあります。私たちのスコアが示すのは引用される確率であり、トラフィック量ではありません。
引用率は、収益への影響を保証するものではありません。
AI経由の紹介トラフィックは、従来のオーガニックトラフィックよりもコンバージョン率が高い傾向にあります(複数の調査で、Googleオーガニックの5倍から23倍のコンバージョンが確認されています)が、絶対的な量としてはウェブトラフィック全体の1%未満にとどまります。可視性スコアが高いことは、ポジショニングの質を示すシグナルであり、収益予測ではありません。
対応度スコアは前提条件についてのものであり、保証ではありません。
対応度スコアが90/100であるということは、あなたのページに正しい技術的シグナルが整っていることを意味します。引用されることを保証するものではありません。サイト外の要因(Redditでの存在感、ウェブ全体でのブランド言及、Wikipedia/Wikidataでのエンティティ認識、レビューサイトのプロフィール)は、ページ単体からは測定できない、引用を左右する主要な要因です。
クロールできないものは測定できません。
私たちの監査は、AIクローラーと同じ方法であなたの公開ページを取得します。コンテンツが認証の背後にある場合、サーバーレンダリングなしで完全にJavaScriptによって読み込まれる場合、あるいは私たちに知らされていないサブドメイン上にある場合、それらを評価することはできません。
スコアはツール間で比較できません。
WhoCanFindMeのスコア65は、Otterly、Peec、Profound、その他どのツールの65とも比較できません。ツールごとにクエリセット、反復回数、対象エンジンの組み合わせ、重み付けがすべて異なります。業界標準は存在しません。私たちのスコアは調整され、内部的に一貫性を保っていますが、時間の経過に伴う改善を追跡できるものであり、業界共通の絶対値ではありません。
調査と出典
私たちの測定方法は、公開された学術研究と一次的な実務者調査に基づいています。この分野は変化が速いため、主要な統計は四半期ごとに再検証しています。根拠の強さを示すラベルについて:実証済み=対照研究、または複数の研究で再現されたもの。有力=単一の研究、または妥当なメカニズムを伴う強い実務者間の共通認識。俗説=広く語られているが研究の裏付けがないもの。
Princeton / IIT Delhi / Georgia Tech GEO paper (Aggarwal et al., KDD 2024)
統計データの追加で+41%、情報源の引用で+34%、引用文の追加で+28%の引用増加。Bing Chat形式のシステムでn=10,000クエリを対象とし、Perplexityで検証済み。
実証済みGoogle AI Overviews measurement study (arxiv:2605.14021, June 2026)
AIOの発生率は全体で13.7%、質問形式のクエリでは64.7%。AIOに引用されるドメインは、1ページ目のオーガニック検索結果よりも信頼性が高い(0.732対0.645)。AIO引用の30%は上位のオーガニック検索結果には表示されない。
実証済みAhrefs llms.txt study (May 2026, 137,000 domains)
llms.txtファイルの97%がAIボットからのトラフィックをまったく受け取らなかった。リクエストの96%はAIエンジンではなく、自動監査ツールによるものだった。
実証済みSeer Interactive ChatGPT/Bing correlation study (2025)
ChatGPT Searchの引用の87%が、Bingの上位10件のオーガニック検索結果と一致。
実証済みWellows E-E-A-T and AIO study
AIO引用の96%が、E-E-A-Tの高い情報源から。著者名が明記されている場合、引用される可能性が2.3倍。ドメインオーソリティとAIOの相関:r=0.18。外部でのブランド言及との相関:r=0.664。
有力SE Ranking Reddit study
Redditでの言及が50件以上のドメインは、引用指数22.5。11から50件の言及では10.4。
有力Schanbacher 2026 FAQ schema study (n=1,508 real estate websites)
FAQPageスキーマは、ChatGPTに表示されるサイトの6.2%に存在。表示されないサイトでは0.8%。
有力OtterlyAI llms.txt 90-day experiment
AIクローラーのリクエストのうち、/llms.txtにアクセスしたのはわずか0.1%。
実証済みSemrush 2026 AI Visibility Index (126M US AI search prompts)
マーケティング責任者の45%が、自社のAI可視性を正確に測定できていません。対象は2026年1月から4月にかけて、2,500から126Mのプロンプトへと拡大しました。
実証済みSuperprompt.com conversion analysis (12M website visits)
AI経由の紹介トラフィックのコンバージョン率は14.2%、Googleオーガニックは2.8%。
有力今すぐスコアを確認
無料監査を実行すれば、30秒以内にChatGPT、Gemini、Perplexity、Claudeにおける対応度スコアがわかります。登録は不要です。
関連: カテゴリー別ベンチマークデータ · 料金 · 無料監査