五面红旗 · 三样该要的东西 · 五个现场提问

GEO审计指南 · 识别不靠谱的 GEO 服务

采购 GEO 审计服务之前先读这一页。判断标准只有一条:结论能不能回溯到可核对的证据。GEO审计哨兵自己也要接受同样的检验——拿这套标准问任何一家服务商,包括我们。

更新于 2026 年 10 月 9 日

五面红旗(看到就警惕)

承诺排名或固定名次

没有人能控制模型答案。话术越笃定,越要怀疑。

不给原始回答存证

只给分数和截图,不给可回溯的原始回答,结论就无法核对,也无法复现。

不说清测试条件

用什么模型、什么题目、什么时候测的、怎么统计的,一项都说不清,结果就不可比、不可信。

把静态分数冒充真实 AI 推荐率

规则检查的分数说明信号齐不齐,不是模型是否推荐你。两者混着报,是常见的包装手法。

用「行业常识」替你补数据

没测到的东西按行业惯例补上凑数,这不是审计,是编故事。种子词、价格、客群提取出几个就是几个,缺的应该标出来。

三样该要的东西

原始回答存证

每条结论都能回溯到某一次真实回答,并注明模型与采集时间。

明确的方法说明

题组怎么出、品类题与品牌题怎么分层、统计口径是什么,写成文字给你。

同条件复测的前后对照

整改后用同样条件再测一遍。改没改善,对照说了算,不靠承诺。

五个现场提问(问退一个是一个)

你们统计的是提及率还是推荐率?两者怎么区分?

答不上分层口径的,报表价值存疑。

品类题(题面不带品牌)和品牌题是分开统计的吗?

两类题混算,是数据失真的第一大来源。

能给我看原始回答吗?每条结论都能对上吗?

当场要,看反应速度和完整度。

这次是什么模型、什么时间测的?换一个模型结论还成立吗?

考察对方是否诚实交代样本边界。

哪些结论是测出来的,哪些是推演?

好的服务商会主动把事实与推演分开;含糊其辞的,默认按推演打折。