跳到主要内容

实操指南

品牌提及、引用与信息准确性应该怎样记录?

区分自然提及、官网引用与信息准确性,用明确标注的教学数字解释分子、分母、缺失样本和前后比较条件。

本文目录

品牌提及、来源引用和信息准确性回答不同的问题。提及说明答案出现了品牌;引用说明答案链接了某个来源;准确性需要把具体表述与可核验事实对照。观察 GEO 表现时,应分别记录它们,再说明各自的问题范围和有效样本。

本文提供一套人工复核与汇报方法,不把它描述为所有工具的统一算法。使用豆见时,应同时查看对应页面展示的数据口径与原始记录。

先确定一条样本代表什么

一次观察至少对应实际问题文本、问题版本、平台及功能、账号视角和采集时间。如果同一道问题在不同平台或不同轮次取得回答,应分别保存记录。

在汇总前给记录分类:已经成功取得、仍在等待、执行失败、取得了回答但暂时无法判断,以及不符合本次指标目标。后四类不能简单补成“品牌未提及”。

同一条回答可能包含多个品牌和多个来源链接。按回答统计命中比例,与按链接数量统计来源分布,是两种口径;汇报时应说明自己采用哪一种。

自然提及率只使用符合观察目标的问题

若目的是观察 AI 是否自然想到某个品牌,问题文本就不应提前提示该品牌及其别名,并且提问场景应当有合理机会涉及产品或品牌选择。

可以采用以下记录口径:

自然提及率 = 出现目标品牌的合格自然提及回答数 ÷ 全部合格自然提及回答数。

“合格”意味着实际取得了可判断的成功回答,题干符合自然提及目标,并且属于事先确定的问题与采集范围。判断品牌名称时应核对别名和同名歧义,不能只看某个字符串是否出现。

问题类型可以观察什么是否直接进入自然提及率
面向明确需求询问有哪些产品可供比较是否自然出现品牌及其语境经人工确认符合目标后纳入
询问已知品牌的部署方式品牌事实是否准确、是否给出来源不纳入,题干已提示品牌
询问已知品牌的服务风险评价方向、依据与需要核实的信息不纳入,单独记录评价
解释通用技术概念知识覆盖与来源引用不预设应出现品牌,按事先目标决定

问题怎样设计可参考客户问题筛选指南。应在采集前确定纳入标准,不能看到答案后再挑选有利的分母。

引用比例要写清楚引用了谁

“回答给出引用”“引用了品牌官网”“引用了某篇目标文章”分别描述不同现象。引用行业资料并不表示推荐了这篇资料所属的公司;品牌被提及时也可能完全没有来源链接。

如果需要观察官网内容是否成为来源,可以明确使用:

官网引用回答占比 = 至少引用一条已确认官网页面的合格回答数 ÷ 全部合格的来源观察回答数。

这里按回答计数,同一条回答引用三个官网链接仍只算一次命中。若另做链接数量或域名分布分析,单独列出统计结果,不把两种数字混用。

每条引用尽量保留完整 URL、页面标题和回答中的对应位置,并实际核对链接是否属于目标官网、页面是否能够支撑相应表述。只有域名或一个总数时,通常还不足以完成这些判断。

成功取得回答且能够完整判断没有引用,可以记录为未命中;回答截断、来源信息未取得或引用提取失败,应列为缺失或待核实。若某种平台功能不提供引用,就单独说明该功能的能力范围,不与提供引用的功能直接比较。

信息准确性从具体陈述开始

把需要核对的回答拆成具体陈述,例如产品支持的部署方式、服务范围或适用条件,再给每条陈述匹配当前可公开、可核验的资料。

建议至少区分四类结果:与资料一致、有明确冲突、缺少必要信息,以及暂时无法核实。没有找到公开依据,不自动等于陈述错误;回答没有覆盖某项功能,也不等于它作出了错误承诺。

记录项应保存的依据
待核对陈述回答原文中的具体句子或位置
对照事实已确认的功能、范围或限制条件
来源与版本公开页面链接及资料核对日期
判断一致、冲突、遗漏或待核实
后续处理核实资料、纠正表述或补充公开说明

如果确实需要计算准确性比例,应先定义陈述的拆分规则、什么算可判定、由谁复核,再明确分子和分母。否则用逐项核对表比单一“准确率”更容易解释,也避免把模型评分误当成已验证事实。

用一组教学数字理解缺失样本

下面的数字完全为计算示例,不来自客户、监测任务或真实平台回答,也不代表豆见的效果。

假设本轮计划观察 12 条符合自然提及目标的记录,其中 9 条成功且可判断、2 条执行失败、1 条仍在等待;9 条合格回答中有 3 条出现目标品牌,则本轮自然提及率为 3 ÷ 9,约 33.3%。同时应报告“有效样本 9,失败 2,等待 1”,不能写成 3 ÷ 12。

如果这 9 条回答同时满足预先确定的来源观察条件,其中 2 条引用了已确认的官网页面,则按回答计算的官网引用占比为 2 ÷ 9,约 22.2%。两个指标的命中记录未必相同。

两项计算共用分母,只是因为这个教学例子明确假设合格样本一致。实际记录里,引用信息可能缺失、问题目标也可能不同,需要分别计算有效样本。没有任何合格样本时,应显示“暂无有效样本”,不计算为 0%。

前后比较时保留共同范围

在查看汇总比例前,核对问题版本、平台与功能、账号视角、采集方法以及时间范围是否相容。新增问题没有同版本的历史记录,应与原有可比问题分开呈现。

补采失败样本会改变证据完整度;重新生成报告可能只改变文字组织;一次内容发布则代表某项行动完成。它们都不能单独证明品牌表现改善。关于报告与复测的区别,可阅读诊断与持续监测说明

汇报可以按这个顺序组织:先说明样本范围与缺失,再展示三个观察维度,最后列出变化、可能的解释和下一步需要取得的证据。保留没有变化和不符合预期的记录,才能支持后续复核。

参考与下一步

Google 官方说明 AI Mode 与 AI Overviews 可能采用不同模型和技术,回答与链接也可能不同。[1] 这项说明适用于 Google Search;观察其他平台时,应另行核对实际功能与返回结果,不假定所有条件一致。

  1. Google Search Central,AI features and your website — How AI features work in Search。本文引用其功能差异说明,上述人工记录公式不是 Google 官方指标。

开始记录前可查看平台采集条件指南,使用豆见时按监测与复测帮助完成相应操作。