五面红旗(看到就警惕)
承诺排名或固定名次
没有人能控制模型答案。话术越笃定,越要怀疑。
不给原始回答存证
只给分数和截图,不给可回溯的原始回答,结论就无法核对,也无法复现。
不说清测试条件
用什么模型、什么题目、什么时候测的、怎么统计的,一项都说不清,结果就不可比、不可信。
把静态分数冒充真实 AI 推荐率
规则检查的分数说明信号齐不齐,不是模型是否推荐你。两者混着报,是常见的包装手法。
用「行业常识」替你补数据
没测到的东西按行业惯例补上凑数,这不是审计,是编故事。种子词、价格、客群提取出几个就是几个,缺的应该标出来。
三样该要的东西
原始回答存证
每条结论都能回溯到某一次真实回答,并注明模型与采集时间。
明确的方法说明
题组怎么出、品类题与品牌题怎么分层、统计口径是什么,写成文字给你。
同条件复测的前后对照
整改后用同样条件再测一遍。改没改善,对照说了算,不靠承诺。
五个现场提问(问退一个是一个)
你们统计的是提及率还是推荐率?两者怎么区分?
答不上分层口径的,报表价值存疑。
品类题(题面不带品牌)和品牌题是分开统计的吗?
两类题混算,是数据失真的第一大来源。
能给我看原始回答吗?每条结论都能对上吗?
当场要,看反应速度和完整度。
这次是什么模型、什么时间测的?换一个模型结论还成立吗?
考察对方是否诚实交代样本边界。
哪些结论是测出来的,哪些是推演?
好的服务商会主动把事实与推演分开;含糊其辞的,默认按推演打折。