两类指标
整套方法建立在一个简单的区分上。呈现类指标衡量你在 LLM 回答中的位置:变化快,用来指导日常工作。成效类指标衡量对业务的真实影响:潜在客户、注册、成交,通常滞后数周。前者证明投入值得,后者证明预算合理。两者缺一不可。
呈现类指标:提示词监测
先建立一个能代表你的业务和产品目标的提示词库,比如电子发票。Peec、Profound 或 Otterly 之类的提示词监测工具每天在各个模型上重放这些提示词,并收集三样东西:提及(你的品牌出现在回答中)、引用(你的品牌被列为来源)和位置(你的提及在回答中的平均排名)。
从这三项原始数据中,我提炼出五个指标。
| 指标 | 计算方式 | 它说明什么 |
|---|---|---|
| 声量份额 | 你的提及数占全部提及数的比例 | 你相对其他品牌的表现。本身没有商业含义,但其趋势能验证你的努力是否有效。 |
| 可见度 | 在全部提示词中被提及的比率 | 你对提示词库所定义范围的覆盖程度。很好的工作指标。 |
| 位置 | 你的提及相对竞争对手的排名 | 在我看来最珍贵:被最先提及很可能意味着更高的可信度。 |
| 加权提及 | 所有提示词上排名倒数的平均值,折算为百分制(公式见表下) | 每天跟踪,它是真正的驾驶舱指标,也是最能说明问题的一个。 |
| 加权声量份额 | 同样的计算,应用到每个竞争对手 | 将覆盖度和位置与市场对比。比传统声量份额更丰富,两者互补。 |
加权提及值得写出公式,因为它是指导工作的核心。对每个提示词,你的提及按排名的倒数计分:第一名记 1,第二名记 0.5,第三名记 0.33,未出现记 0。把这些得分在整个提示词库上取平均再乘以 100,就得到该指标。以 100 个提示词为例:30 次第一、20 次第二、10 次第三,即 (30 × 1 + 20 × 0.5 + 10 × 0.33) / 100 × 100 ≈ 43 分(满分 100)。
再加两项定性观察。先看引用:被引用的网址会影响模型的叙事,所以要深挖哪些来源有效,用它们来论证投入或排定优先级,比如先去影响哪些讨论帖、联系哪些视频创作者,同时观察竞争对手的动作。再看情感:模型谈论你的方式。如果你定期向会谈及你品牌的第三方供料,就跟踪每个事件(比如新获得的认证)对整体或分产品情感的影响。
四个补充来源
| 来源 | 用途 |
|---|---|
| 搜索引擎的数据 | Bing 和 Google 会发布自己的 AI 相关数据,主要用来论证预算分配,或深入研究某个具体问题。 |
| 服务器日志 | 日志中爬虫的活动能回答具体问题:你上线了一项帮助模型理解网站的技术改进,抓取端有什么变化? |
| 第三方数据 | 一些样本面板,比如 Similarweb,能判断某位访客是否在访问你网站的同一天也访问了某个 LLM。需谨慎对待,但这个视角很宝贵。 |
| AI Overviews 监测 | 衡量策略或网站改动效果的好用工作指标:新内容、新排版。 |
成效类指标:真实影响
先问声明。「您是怎么知道我们的?」这个问题衡量真实的商业影响,其结论常与归因模型相左。少了它,你会错过最常见的场景:有人在 LLM 里读到推荐,去 Google 搜索你的品牌,点击付费或自然链接。任何归因模型都看不见这条链路。
再看分析工具。在 GA4 中筛选 LLM 特有的来源地址(chatgpt.com、perplexity.ai、copilot.microsoft.com、gemini.google.com、claude.ai):访客点击回答中的链接而来时即可归因。再结合 cookie:如果潜在客户先访问你的网站、转到 LLM、又回来,按你的归因理念(首次点击、末次点击或混合)应该能看到。
最后是间接信号。品牌流量和直接流量无法解释的上升,与声明数据遵循同一逻辑。每天让系统分析销售团队的通话记录,找出把 LLM 列为来源的潜在客户,一个小自动化就够了。同时留意公开或付费的调研报告,它们记录人们如何搜索:总有启发。
| 信号 | 捕捉什么 | 局限 |
|---|---|---|
| 声明数据 | 潜在客户认识你的真实渠道 | 取决于受访者的记忆和诚实 |
| 分析工具(GA4) | 来自 LLM 回答的直接点击 | 看不见先读推荐再搜品牌的场景 |
| 间接信号 | 品牌流量、销售通话记录、调研 | 只是相关性,单独不构成证据 |
汇总一切
最后一环最简单:把所有数据汇集到一处,交给 Claude 每周分析一次,并以 Slack 消息发送趋势变化的简短摘要。只有每周有人读,测量才有价值。
2026 年,LLM 对潜在客户获取的影响读不出自任何现成的仪表盘。它要靠一个个呈现类指标和成效类指标重建,直到两条曲线讲出同一个故事。
常见问题
更多关于测量与生成式搜索的分析,见日志。