实操指南
品牌提及、引用与信息准确性应该怎样记录?
区分自然提及、官网引用与信息准确性,用明确标注的教学数字解释分子、分母、缺失样本和前后比较条件。
本文目录
品牌提及、来源引用和信息准确性回答不同的问题。提及说明答案出现了品牌;引用说明答案链接了某个来源;准确性需要把具体表述与可核验事实对照。观察 GEO 表现时,应分别记录它们,再说明各自的问题范围和有效样本。
本文提供一套人工复核与汇报方法,不把它描述为所有工具的统一算法。使用豆见时,应同时查看对应页面展示的数据口径与原始记录。
先确定一条样本代表什么
一次观察至少对应实际问题文本、问题版本、平台及功能、账号视角和采集时间。如果同一道问题在不同平台或不同轮次取得回答,应分别保存记录。
在汇总前给记录分类:已经成功取得、仍在等待、执行失败、取得了回答但暂时无法判断,以及不符合本次指标目标。后四类不能简单补成“品牌未提及”。
同一条回答可能包含多个品牌和多个来源链接。按回答统计命中比例,与按链接数量统计来源分布,是两种口径;汇报时应说明自己采用哪一种。
自然提及率只使用符合观察目标的问题
若目的是观察 AI 是否自然想到某个品牌,问题文本就不应提前提示该品牌及其别名,并且提问场景应当有合理机会涉及产品或品牌选择。
可以采用以下记录口径:
自然提及率 = 出现目标品牌的合格自然提及回答数 ÷ 全部合格自然提及回答数。
“合格”意味着实际取得了可判断的成功回答,题干符合自然提及目标,并且属于事先确定的问题与采集范围。判断品牌名称时应核对别名和同名歧义,不能只看某个字符串是否出现。
| 问题类型 | 可以观察什么 | 是否直接进入自然提及率 |
|---|---|---|
| 面向明确需求询问有哪些产品可供比较 | 是否自然出现品牌及其语境 | 经人工确认符合目标后纳入 |
| 询问已知品牌的部署方式 | 品牌事实是否准确、是否给出来源 | 不纳入,题干已提示品牌 |
| 询问已知品牌的服务风险 | 评价方向、依据与需要核实的信息 | 不纳入,单独记录评价 |
| 解释通用技术概念 | 知识覆盖与来源引用 | 不预设应出现品牌,按事先目标决定 |
问题怎样设计可参考客户问题筛选指南。应在采集前确定纳入标准,不能看到答案后再挑选有利的分母。
引用比例要写清楚引用了谁
“回答给出引用”“引用了品牌官网”“引用了某篇目标文章”分别描述不同现象。引用行业资料并不表示推荐了这篇资料所属的公司;品牌被提及时也可能完全没有来源链接。
如果需要观察官网内容是否成为来源,可以明确使用:
官网引用回答占比 = 至少引用一条已确认官网页面的合格回答数 ÷ 全部合格的来源观察回答数。
这里按回答计数,同一条回答引用三个官网链接仍只算一次命中。若另做链接数量或域名分布分析,单独列出统计结果,不把两种数字混用。
每条引用尽量保留完整 URL、页面标题和回答中的对应位置,并实际核对链接是否属于目标官网、页面是否能够支撑相应表述。只有域名或一个总数时,通常还不足以完成这些判断。
成功取得回答且能够完整判断没有引用,可以记录为未命中;回答截断、来源信息未取得或引用提取失败,应列为缺失或待核实。若某种平台功能不提供引用,就单独说明该功能的能力范围,不与提供引用的功能直接比较。
信息准确性从具体陈述开始
把需要核对的回答拆成具体陈述,例如产品支持的部署方式、服务范围或适用条件,再给每条陈述匹配当前可公开、可核验的资料。
建议至少区分四类结果:与资料一致、有明确冲突、缺少必要信息,以及暂时无法核实。没有找到公开依据,不自动等于陈述错误;回答没有覆盖某项功能,也不等于它作出了错误承诺。
| 记录项 | 应保存的依据 |
|---|---|
| 待核对陈述 | 回答原文中的具体句子或位置 |
| 对照事实 | 已确认的功能、范围或限制条件 |
| 来源与版本 | 公开页面链接及资料核对日期 |
| 判断 | 一致、冲突、遗漏或待核实 |
| 后续处理 | 核实资料、纠正表述或补充公开说明 |
如果确实需要计算准确性比例,应先定义陈述的拆分规则、什么算可判定、由谁复核,再明确分子和分母。否则用逐项核对表比单一“准确率”更容易解释,也避免把模型评分误当成已验证事实。
用一组教学数字理解缺失样本
下面的数字完全为计算示例,不来自客户、监测任务或真实平台回答,也不代表豆见的效果。
假设本轮计划观察 12 条符合自然提及目标的记录,其中 9 条成功且可判断、2 条执行失败、1 条仍在等待;9 条合格回答中有 3 条出现目标品牌,则本轮自然提及率为 3 ÷ 9,约 33.3%。同时应报告“有效样本 9,失败 2,等待 1”,不能写成 3 ÷ 12。
如果这 9 条回答同时满足预先确定的来源观察条件,其中 2 条引用了已确认的官网页面,则按回答计算的官网引用占比为 2 ÷ 9,约 22.2%。两个指标的命中记录未必相同。
两项计算共用分母,只是因为这个教学例子明确假设合格样本一致。实际记录里,引用信息可能缺失、问题目标也可能不同,需要分别计算有效样本。没有任何合格样本时,应显示“暂无有效样本”,不计算为 0%。
前后比较时保留共同范围
在查看汇总比例前,核对问题版本、平台与功能、账号视角、采集方法以及时间范围是否相容。新增问题没有同版本的历史记录,应与原有可比问题分开呈现。
补采失败样本会改变证据完整度;重新生成报告可能只改变文字组织;一次内容发布则代表某项行动完成。它们都不能单独证明品牌表现改善。关于报告与复测的区别,可阅读诊断与持续监测说明。
汇报可以按这个顺序组织:先说明样本范围与缺失,再展示三个观察维度,最后列出变化、可能的解释和下一步需要取得的证据。保留没有变化和不符合预期的记录,才能支持后续复核。
参考与下一步
Google 官方说明 AI Mode 与 AI Overviews 可能采用不同模型和技术,回答与链接也可能不同。[1] 这项说明适用于 Google Search;观察其他平台时,应另行核对实际功能与返回结果,不假定所有条件一致。
- Google Search Central,AI features and your website — How AI features work in Search。本文引用其功能差异说明,上述人工记录公式不是 Google 官方指标。