团队整理了几十张截图:AI提到了品牌,引用了官网,甚至把产品放进推荐名单。它们能证明在那些具体回答中出现过,却还不能说明覆盖了多少真实需求,更不能直接说明新增了多少客户。
GEO评估需要把答案表现、访问行为和业务结果接起来,同时保留每一层的测量边界。
一、先把“出现了”拆成可核查的指标
建议建立三层指标,而不是把所有信息压成一个综合分。
| 层次 | 核心指标 | 回答的问题 |
|---|---|---|
| 答案表现 | 品牌提及率、官网引用率、产品推荐率 | 是否进入答案,以什么身份出现 |
| 表达质量 | 关键事实准确性、引用支持情况、场景匹配 | 说得是否正确,推荐是否合适 |
| 业务结果 | 可识别访问、有效咨询、试用与成交 | 用户是否继续行动,产生多少价值 |
提及率可以定义为“出现品牌的有效回答数÷有效回答总数”;官网引用率则是“至少引用一次官网的有效回答数÷有效回答总数”。同一回答引用五个官网页面,在这个口径中仍算一次;页面引用次数另行统计。
产品推荐应有明确标注规则:只是提到某品牌作为反例,不算正向推荐;列入候选但强调不适用,也应单独记录。
还可以统计“联网回答中的引用率”,但必须与“全部有效回答中的引用率”分开。没有联网的有效回答仍应留在总样本里;请求失败则记录失败率,不应悄悄删掉或算作品牌缺席。
如果答案观点与自己的文章相似,却没有来源证据,不能认定“AI用了我们的内容但没署名”。可观测的是相似表述,不是模型内部的信息来源。
表达质量还可以细化成三个检查项:署名是否正确,关键论断是否忠实于资料,答案进入下一轮追问后是否仍准确。品牌被张冠李戴、产品版本混淆,以及“可能适合”变成“保证有效”,都值得单独标注。
对多轮决策,可以设计“初选产品—询问价格—核对迁移限制”的固定脚本,记录品牌是否仍在候选中、推荐理由是否变化。这测量的是脚本条件下的表现,不是平台全部真实用户的对话延续率。
二、用固定样本观察变化
早期可以选20—30个真实问题,覆盖品牌核实、品类比较和具体任务;在目标用户常用的平台重复测试。这个规模只是试点建议,不能代表全市场。
每条记录至少保留:问题原文、平台入口、已知模型或模式、联网状态、地区语言、时间、完整回答、引用URL和标注结果。独立问题宜使用新会话;多轮决策另设一套固定脚本,避免上下文混入后无法比较。
实际操作可先做一张“问题×平台”矩阵,每个格子链接到原始回答,再记录提及、引用、推荐与准确性。三者不是互斥状态,不宜强行只选一个。下面是单个问题在同一轮测试中的虚构示例:
| 入口 | 提及品牌 | 引用官网 | 推荐产品 | 事实检查 |
|---|---|---|---|---|
| 平台A | 是 | 否,引用第三方评测 | 是 | 将专业版功能写成全版本支持 |
| 平台B | 是 | 是 | 否,仅用于解释品类 | 描述准确 |
| 平台C | 否 | 否 | 否 | 有效回答,未包含该品牌 |
平台A的重点是查清错误来源,平台B说明官网已参与解释但尚未进入推荐,平台C则需要继续排查需求匹配与内容覆盖。保留这些差别,比统一涂成“有曝光”的绿色格子更有帮助。
同一问题需要跨时间重复观察。模型输出波动、索引更新和产品版本变化,都可能影响结果。一轮没有出现,不足以证明优化失败;一次排在前面,也不意味着获得了稳定位置。
问题库分为固定核心题和探索题。核心题用于长期对比,探索题补充新需求;问题权重若依据业务价值制定,应提前固定并说明。没有真实用户查询分布时,监测结果只能称为“样本中的可见性”,而不是市场份额。
引用质量适合人工抽检。Liu等人的研究将“陈述是否有充分引用支持”和“引用是否支持对应陈述”分开评估,这有助于识别“链接存在,但条件被说错”的情况。
一次引用审计可以这样做:先圈出答案中的价格、功能、比较结论等关键陈述;打开相邻引用,定位原文依据;核对版本、日期与条件;将结果记为支持、部分支持、不支持或暂无法核查。付费墙、页面失效等情况属于核查受限,应与已经发现矛盾区分。
重复转载还需要追到原始发布方。一份材料被多个站点转发,说明传播范围扩大,但不能当作多项独立验证。对影响采购或品牌声誉的陈述,优先人工复核。
三、把官方数据、抽样和站内行为互相校验
平台官方数据通常比人工截图覆盖更广,但也有各自范围。Bing在2026年推出的AI Performance公开预览,展示Microsoft Copilot、Bing的AI摘要及部分合作集成中的引用活动,包括被引用URL和趋势;其检索词信息是抽样数据,引用次数也不表示答案中的位置或权威等级。
Google的AI功能表现则计入Search Console的整体Web搜索数据。不能把这份报告的全部增长都归因于AI答案。
站内分析可以识别部分来自AI平台的引荐访问,再追踪落地页、注册和有效咨询。但应用内跳转、隐私设置及跨设备行为可能丢失来源;用户先看到答案,几天后搜索品牌访问,也很难被完整识别。
因此,直接引荐适合观察可识别链路,品牌搜索和自报来源可补充线索,却不能简单相加成“GEO新增客户”。也不能把全部直接访问都视为漏记的AI流量。
工具选择应优先检查:采集的是真实产品入口还是API,能否保存原始答案,如何处理失败,支持哪些地区和模式。来源不同的数据可以并列观察,不宜直接混成同一个趋势。
四、用差异定位下一步工作
假设官网引用率上升,但有效咨询没变,可以继续分解:获得引用的问题是否有购买意图?用户是否点击?落地页是否回答了采购顾虑?表单和试用是否存在障碍?
如果提及增加、描述错误也增加,应优先检查产品版本和来源冲突;如果访问量不大但有效线索比例高,则值得关注高价值问题的覆盖,而不是立即追求更宽泛的曝光。
每个异常都先形成假设,再用页面检查、答案抽样或站内实验验证。全平台缺席不一定是技术封禁,可能只是主题竞争强;引用别人也不自动证明自己的结构差。
排查时可以按证据强弱推进:先检查可访问性与版本等可直接验证的问题,再比较内容完整性、独有依据和表达结构;如果这些都没有明显缺口,继续观察竞争与平台变化,不必每轮都重写文章。
还有一个容易遗漏的环节是“承接是否兑现”。用户从答案里的迁移说明点击进来,落地页是否直接展示模板与限制?手机上能否读表、下载或申请试用?来源引用正确、落地页却找不到对应答案,同样会造成流失。引用审计和落地页走查最好配套进行。
一份有用的周报可以只保留:主要指标及口径、三个值得解释的变化、两个待验证假设和下一轮动作。GEO测量的目标,是让团队知道下一步改什么,以及证据足不足以支持扩大投入。