方法论
我们如何衡量 AI 搜索可见性
这是一份诚实、公开的说明:评分意味着什么,我们如何计算,以及更重要的,它无法告诉你什么。方法论是我们最引以为豪的部分,理应被公开。
最后更新:2026 年 6 月 · 这个领域变化很快,我们每季度都会重新核实关键统计数据。
我们衡量什么
WhoCanFindMe 衡量两件不同的事情,理解这两者的区别很重要:
- AI 就绪度(免费审计)。 这是一个确定性的启发式评分,基于我们直接从你的公开页面提取的信号:robots.txt 规则、结构化数据、内容可提取性、新鲜度信号和技术健康度。由于不需要调用任何实时 AI API,它几秒钟内就能完成,也完全免费。它告诉你的是,你的页面是否具备被 AI 爬虫和解析器发现的条件。
- 实测可见度(付费套餐)。 向 ChatGPT、Perplexity 和 Gemini 发送实时联网查询,并向 Claude(目前尚无原生联网搜索 API)发送一次训练数据回忆查询,来衡量你的品牌是否真的出现在回答里。其中三个引擎基于实时检索,Claude 则是训练记忆检验。完整细节见第 4 节。
这个区别很重要。就绪度评分告诉你的是 AI 可见性所需的技术前提条件;实测可见度告诉你的是实际结果。可以把就绪度理解成「门锁开了吗?」,把实测可见度理解成「真的有人走进来了吗?」
六项就绪信号
就绪度评分由六个信号类别汇总而成,每一项都可以直接从你的公开页面独立测量,无需调用任何 AI API。
AI 爬虫访问权限
高是什么: 主流 AI 爬虫能否触达你的内容。
我们如何测量: 我们会解析你的 robots.txt,查找是否存在针对 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 和 Google-Extended 的明确 Disallow 规则。如果某个爬虫被屏蔽,对应的引擎就无法收录你的页面:无论内容质量如何,都会被彻底排除在引用之外。
证据: 共识:爬虫访问权限是一道二元门槛。87% 的 ChatGPT 引用与 Bing 前 10 名的搜索结果相符(Seer Interactive,2025),因此需要 OAI-SearchBot 访问权限的 Bing 收录,是决定 ChatGPT 可见性最关键的单一信号。
结构化数据
对 Gemini 影响较高,对其他引擎影响中等是什么: 让 AI 引擎能够将你的内容解析为结构化事实的 JSON-LD 结构化标记。
我们如何测量: 我们会扫描页面的 JSON-LD 代码块,查找 FAQPage、Article、HowTo、Organization 和 BreadcrumbList 类型。FAQPage 是优先级最高的类型:一项 2026 年针对 1,508 个房地产网站的研究发现,在 ChatGPT 可见的网站中有 6.2% 部署了 FAQPage 结构化数据,而在不可见的网站中这一比例只有 0.8%。
证据: 很可能:对照研究(Schanbacher,2026,n=1,508)。其他结构化数据类型在独立研究中呈现出的相关性并不一致,甚至没有相关性:不要把结构化数据当成万能解药。
可提取性
对 Claude 影响最高,对其他引擎影响较高是什么: AI 能多容易地在你的页面中找到并引用最相关的段落。
我们如何测量: 我们会检查答案优先结构(前约 200 字内是否给出直接答案)、标题数量、FAQ 式问答对、列表和表格,以及 Flesch 可读性指标。开头就直接回答问题的页面,有 44% 的概率会从其内容的前三分之一被引用(业界研究)。Flesch 可读性得分在 50 到 70 之间时,最有利于被 AI 引用。
证据: 很可能:业界共识,加上 Princeton GEO paper 的发现,即内容结构信号与引用提升存在相关性(n=10,000 次查询,Perplexity)。
权威性与事实密度
对 Perplexity 影响最高,对 Gemini 影响较高是什么: 页面通过事实性内容展示自身可信度的程度。
我们如何测量: 我们会统计数据和百分比(根据 Princeton GEO paper,数值型表述可将引用概率提升约 41%)、指向权威域名的外链、正文内引用,以及整体字数(作为内容深度的替代指标)。这些都是 E-E-A-T 信号的替代指标,96% 的 Google AI Overview 引用都具备这类信号。
证据: 已证实:Princeton GEO paper(数据引用:+41%,引证来源:+34%,n=10,000 次查询)。E-E-A-T 相关性来自 Wellows study(业界研究,2025)。品牌提及与 AIO 的相关性:r=0.664,是我们能从页面本身测量到的最强预测指标。
新鲜度
对 Perplexity 影响最高是什么: 你的页面是否向 AI 引擎说明了信息的新旧程度。
我们如何测量: 我们会检查 JSON-LD 中的 datePublished 和 dateModified、sitemap 的 lastmod,以及 HTML meta 日期标签,并计算最近一次信号距今有多少天。Perplexity 的检索流水线会施加严格的时效性过滤:没有新鲜度信号的页面会被视为可能过时。
证据: 共识:Perplexity 明确将新鲜度记录为排名因素之一。目前还没有量化研究单独分离出新鲜度信号带来的引用提升幅度,但业界共识十分强烈。
技术健康度
对 ChatGPT 影响较高,对其他引擎影响中等是什么: 页面是否真的能被 AI 爬虫抓取和解析。
我们如何测量: 我们会检查 HTTPS、是否返回有效的 HTTP 200 状态码、viewport meta 标签(作为移动端友好度的替代指标),以及页面是否高度依赖 JavaScript 渲染。AI 爬虫通常只抓取原始 HTML、不会执行 JavaScript,因此重度依赖 JS 的页面在它们眼中可能几乎是空白的。
证据: 在 HTTPS 和 JS 渲染方面已有共识。页面速度的影响:在一项业界研究中,FCP 低于 0.4 秒的页面平均获得 6.7 次 ChatGPT 引用,而 FCP 超过 1.13 秒的页面只有 2.1 次,但这一结果尚未经过独立复现,仅供参考。
关于 llms.txt 的说明
我们会把缺少 /llms.txt 文件标记为提示性问题(而非严重问题)。目前的证据并不支持它的重要性:Ahrefs 在 2026 年 5 月对 137,000 个域名的研究发现,97% 的 llms.txt 文件没有收到过任何 AI 爬虫的访问。我们保留这项信号,是因为这项规范未来可能被更广泛采用,但不会夸大它目前的实际效果。
按引擎评分
由于各个 AI 引擎的检索架构确实不同,它们对六个信号类别的权重分配也各不相同。我们不会给出一个笼统的「AI 评分」,而是先计算每个引擎各自的就绪度评分,再取平均值作为总体的头部数字。
| 信号 | ChatGPT | Perplexity | Gemini | Claude |
|---|---|---|---|---|
| 爬虫访问权限 | 25% | 20% | 20% | 20% |
| 结构化数据 | 15% | 10% | 25% | 20% |
| 可提取性 | 20% | 15% | 15% | 30% |
| 权威性 | 15% | 25% | 20% | 15% |
| 新鲜度 | 10% | 25% | 10% | 5% |
| 技术健康度 | 15% | 5% | 10% | 10% |
ChatGPT格外看重爬虫访问权限,因为它 87% 的引用来自 Bing 前 10 名,而 Bing 需要 OAI-SearchBot 的访问权限。Perplexity最看重新鲜度和权威性,因为它的六阶段 RAG 流水线会严格过滤时效性和事实密度。Gemini最重视结构化数据和权威性信号,这反映了 Google 的 E-E-A-T 框架。Claude把可提取性放在首位,因为它是四个引擎中最挑剔的一个,97.8% 的引用来自内容结构清晰、地位成熟的信源。
任何在 robots.txt 中被屏蔽的引擎,其综合评分都会受到 55% 的扣减(即评分乘以 0.45),这反映出被屏蔽的引擎根本无法收录或引用该页面。
总体就绪度评分是四个引擎各自评分的算术平均值,每个评分都被限制在 [0, 100] 区间内。
实测可见度(实时联网查询)
就绪度评分是 AI 可见性的必要条件,但不是充分条件。实测可见度更进一步:我们会向真实的 AI 引擎发送真实查询,衡量你的品牌是否出现在具备实时依据、可引用的回答中。
为什么用实时联网查询,而不是训练记忆探测
对于大多数主流消费级 AI 引擎(ChatGPT Search、Perplexity、Google AI Overviews 和 Copilot)而言,回答在查询发生的那一刻,都基于实时网络检索。训练记忆决定的是 AI 是否「知道」某个品牌的存在;实时检索决定的是它是否会在回答中引用这个品牌。GEO 本质上是一个检索问题,这也是为什么只要引擎支持,我们都优先采用实时联网查询。
对于 ChatGPT、Perplexity 和 Gemini,我们不会使用基础模型提示词(即在不联网搜索的情况下,直接问 AI 对某个品牌「知道」什么)。这种方式测试的是静态的训练记忆,结果高度不确定,对知名度较低的品牌容易产生幻觉,也无法反映用户在实时联网的消费级引擎中实际看到的内容。Claude 是唯一的例外:就目前的 Anthropic API 而言,Claude 没有类似 OpenAI 或 Google 那样的原生联网搜索工具,因此它的评分必然是一次训练记忆回忆检验,而不是实时测量。我们会在每一个 Claude 评分上标注这一点,并会在 Anthropic 推出联网搜索 API 的第一时间,切换为实时联网查询。
查询集设计
我们会精心构建一套查询集,覆盖三类:发现型查询(基于品类,不含品牌名)、对比型查询(评估阶段)和品牌直问型查询。三者的比例大致为 60/30/10:发现型查询权重最高,因为这是获取新受众的关键环节。每次审计至少 30 条查询才能提供有意义的信号;完整的标准审计使用 50 条。
重复次数与统计处理
单次运行单条查询几乎没有意义。LLM 的非确定性意味着即使在 temperature=0 的情况下,同一条查询在不同运行中也可能产生不同的引用结果(GPU 层面的批处理规模差异无法消除)。Princeton GEO paper 发现,需要重复 60 到 100 次,可见度百分比才能趋于稳定。
每一次重复都会再次发送完全相同的查询,我们不会在各次重复之间改动或改写提示词。标准付费审计每个引擎、每条查询运行 3 次;免费/匿名预览以及 Agency 的常规复查只运行 1 次(单样本快照,不生成区间)。引用率的计算方式是:品牌被引用的运行次数占总运行次数的比例(brandCited = true)。我们使用 Wilson score interval 计算这一比例的 95% 置信区间。这反映的是相同调用在服务商侧抖动下的运行间一致性,而不是同一查询在不同措辞下的引用变化采样。
API 与消费级界面的一致性
对于 ChatGPT、Perplexity 和 Gemini,我们使用各引擎开启联网搜索的程序化 API。这是行业标准做法,也是唯一可规模化的方式,但它会带来一些已知的差距:
- 消费级的 ChatGPT.com 可能包含个性化设置和浏览历史,而 API 无法复现这些内容。
- 接入 Google Search grounding 的 Gemini API,与 Google AI Overviews 之间,被引用最多的域名重合度只有约 38.5%,这是一个结构性差距,我们会在每一个 Google 评分上明确披露。
- Perplexity 官方文档也说明了其 API 与消费级界面之间可能存在差异。
- Claude 的 API 完全没有联网搜索工具,因此它的评分依赖的是模型的训练数据回忆,而非实时 API 调用:这是四个引擎中一致性差距最大的一个,我们会在每一个 Claude 评分上披露这一点。
凡是包含实测可见度评分的报告,我们都会标注这些局限。我们相信,坦诚说明测量的局限性,比制造虚假的精确感更有价值。
置信区间与波动性
AI 可见性评分是一种估计,而不是事实。任何测量都会受到三个波动来源的影响:
- LLM 的非确定性。 即使在 temperature=0 的情况下,由于 GPU 层面的批处理规模差异,API 的返回结果依然会有所不同。一个没有重复运行、只在某一时点采样的评分,在重新运行时可能会有 ±30% 的波动。我们的实测可见度引擎会对每条相同的查询重复运行多次,并针对由此得到的引用率给出 Wilson-score 置信区间。这衡量的是相同调用在服务商侧抖动下的运行间一致性,而不是同一查询在不同措辞下的差异,让你能看清每个数字究竟有多稳定。
- 模型与算法更新。 OpenAI、Google 和 Perplexity 都在持续更新各自的模型,往往不会公开宣布。六周前的评分可能已经不能反映当下的实际情况。我们会在每个评分上标注测量日期,并对超过 30 天的评分做出提醒。
- 地理位置与个性化差异。 同一条查询在不同地区、语言和账号类型下,会得到不同的答案。我们的测量都从标准化的地理位置发出,其他地区的结果可能有所不同。
就绪度评分(免费审计)比实测可见度稳定得多,因为它测试的是确定性信号(robots.txt、结构化数据、HTML 内容),而不是具有随机性的 AI 输出。就绪度评分发生变化,反映的是你页面本身发生了真实的变化。
这项测量能说明什么,不能说明什么
我们认为,对测量局限性保持坦诚,正是一款真正有用的工具和一个看起来煞有介事的评分生成器之间的分界线。以下是这款工具明确无法告诉你的事情:
我们不测量来自 AI 的自然流量。
AI 引用和 AI 引荐流量是两回事。一个品牌可能被大量引用,引荐流量却依然没有起色,因为 AI 平台越来越倾向于直接在界面内给出答案,而不产生外部点击(Digiday,2025)。我们的评分告诉你的是引用概率,而不是流量大小。
引用率不能保证带来收入影响。
AI 引荐流量的转化率高于传统自然流量(多项研究发现比 Google 自然流量高出 5 到 23 倍),但其绝对流量占比仍不足网站总流量的 1%。较高的可见性评分是一种定位质量信号,而不是收入预测。
就绪度评分说明的是前提条件,而不是保证。
90/100 的就绪度评分意味着你的页面已经具备正确的技术信号。但这并不保证你一定会被引用。站外因素(Reddit 上的存在感、全网的品牌提及、Wikipedia/Wikidata 的实体识别、点评网站资料页)都是重要的引用驱动因素,而这些仅凭你的页面本身无法测量。
我们无法测量我们无法抓取的内容。
我们的审计会像 AI 爬虫一样抓取你的公开页面。如果内容位于登录验证之后、完全依赖 JavaScript 加载且没有服务器端渲染,或位于我们未被告知的子域名下,我们就无法对其进行评估。
评分无法跨工具比较。
WhoCanFindMe 给出的 65 分,不能拿来和 Otterly、Peec、Profound 或其他任何工具给出的 65 分作比较。每个工具使用的查询集、重复次数、引擎组合和权重都各不相同,业内并没有统一标准。我们的评分经过校准、内部保持一致:它可以追踪你随时间推移取得的进步,但并不是一个行业绝对值。
研究与来源
我们的方法论建立在已发表的学术研究和一手业界研究之上。这个领域变化很快,我们每季度都会重新核实关键统计数据。证据强度标签:已证实(Proven)指经过对照研究验证、或在多项研究中得到重复验证;很可能(Probable)指仅有单一研究、或有可信机制支撑的强烈业界共识;坊间说法(Folklore)指广为流传但没有研究支持。
Princeton / IIT Delhi / Georgia Tech GEO paper (Aggarwal et al., KDD 2024)
增加数据统计带来 +41%、引用信源带来 +34%、增加引述带来 +28% 的引用提升。n=10,000 次查询,在类 Bing Chat 系统上测得,并在 Perplexity 上得到验证。
已证实Google AI Overviews measurement study (arxiv:2605.14021, June 2026)
AIO 总体触发率为 13.7%,在疑问句形式的查询中为 64.7%。被 AIO 引用的域名可信度高于自然搜索首页结果(0.732 对 0.645)。30% 的 AIO 引用并未出现在自然搜索的靠前结果中。
已证实Ahrefs llms.txt study (May 2026, 137,000 domains)
97% 的 llms.txt 文件没有收到任何 AI 爬虫的访问。96% 的请求来自自动化审计工具,而非 AI 引擎本身。
已证实Seer Interactive ChatGPT/Bing correlation study (2025)
87% 的 ChatGPT Search 引用与 Bing 自然搜索前 10 名结果相符。
已证实Wellows E-E-A-T and AIO study
96% 的 AIO 引用来自高 E-E-A-T 信源。署名作者被引用的可能性高出 2.3 倍。域名权威度与 AIO 的相关性:r=0.18。外部品牌提及的相关性:r=0.664。
很可能SE Ranking Reddit study
拥有 50 次以上 Reddit 提及的域名,引用指数为 22.5,而 11 到 50 次提及的域名为 10.4。
很可能Schanbacher 2026 FAQ schema study (n=1,508 real estate websites)
FAQPage 结构化数据出现在 6.2% 的 ChatGPT 可见网站中,而在不可见网站中仅为 0.8%。
很可能OtterlyAI llms.txt 90-day experiment
只有 0.1% 的 AI 爬虫请求访问过 /llms.txt。
已证实Semrush 2026 AI Visibility Index (126M US AI search prompts)
45% 的营销负责人无法准确衡量自己的 AI 可见性。样本规模在 2026 年 1 月到 4 月间从 2,500 条扩大到 126M 条提示词。
已证实Superprompt.com conversion analysis (12M website visits)
AI 引荐流量的转化率为 14.2%,而 Google 自然流量为 2.8%。
很可能