每个问题问 100 次,就更准吗?

2026-09-04

1
0

每个问题问 100 次,就更准吗?

在中国测 AI 可见度,先得回答另一个问题

通察 GEO 行业观察 · 第3期 · 2026 年 9 月

编者按|通察为什么要谈“问 100 次”

GEO 市场现在不缺更大的数字,也不缺更复杂的测量方案。真正缺少的,是一套能够说明“测到了什么”、也经得起双方复核的验收方法。每个问题问 100 次,可以减少单题波动;但如果测量发生在用户看不到的环境里,或者把单题结果直接当成整体结论,次数再多,也不等于测得更有用。

这篇文章不是替“100 次”或“5 次”站队,也不试图用一个固定次数概括所有项目。我们更关心三个实际问题:单题重复究竟能换来多少精度?在中国做 AI 可见度,为什么要先分清 App 端和 API 端?品牌签约前,采样次数、判定层级和噪声范围,应该怎样写进验收?

海外的两家平台,正在为一个数字吵架

先讲一件今年在海外发生的事。两家做 AI 可见度监测的平台公开吵了一架,争的是一个听起来很技术的问题:测 AI 可见度,每个问题该问多少次?

一方的说法很有杀伤力:我们每个问题问 100 次。你们每天只跑一次,单题就算重复 30 次,误差条也有 11 个百分点——这样的数据不可靠。

另一方回应:你误解了我们的做法——我们从来不测单个问题,跑的是数百到数千个不同问题,各跑一次,报汇总均值。他们还做过实测:753 个问题上,每天跑 1 次与 10 次,结果只差 0.25 个百分点。

 两个都对——但他们说的不是同一层

有一句值得原样抄下来:

「当你关心的单位是某一个具体问题时,重复次数才重要。当你的目标是理解一个品类时,重要的是广度。而后者才是营销人实际在做的事。」

争论没有分出胜负,却把一个被忽略的问题摆上了台面:

100 次和 5 次,比的到底是什么?

我们把这件事算了一遍,也核了学术文献。结论有点出乎意料——双方争的那个数字,可能都不是最关键的。尤其是在中国。

第一件事:精度不是买来的

先看一个和 AI 无关的常识。

做市场调研的人都熟悉一个规律:样本量翻四倍,误差才减半。

这不是经验法则,是数学:抽样误差与样本量的平方根成反比。放到我们讨论的场景:

 成本涨 20 倍,精度只提升约 4.5 倍——4.5 正好是 20 的平方根

从 5 次到 100 次,成本涨了 20 倍,精度只提升约 4.5 倍。这个 4.5,正好是 20 的平方根。

但更值得注意的是最后一行:即便问满 100 次,单个问题的误差范围仍有约 ±10 个百分点。

也就是说,如果报告告诉你「这个问题上你的可见度是 62%」,哪怕真的问了 100 次,真实值也可能落在 52% 到 72% 之间。

所谓「±1 分」,是成千上万道题汇总后的整体精度

所以「100 次」并不等于「单题精确」。

那些漂亮的「±1 分」精度声明,是成千上万道题汇总后的整体精度,不是某一道题的精度。这两件事经常被混为一谈。

这是第一个关键:单题永远不精确,精度产生在汇总层。

回头看开头那场争论——「广度 vs 重复」之所以吵不出结果,正是因为双方在说不同层级的事。一方讲的是单题精度,一方讲的是汇总精度。两个都对,但不是一件事。

第二件事:学术界给的不是次数,是标准

我们核了一篇今年 7 月的综述(arXiv:2607.14035,覆盖 45 项 GEO 研究)。里面几个数字比厂商宣传更值得看:

  • 跨四个引擎、连续 45 天观测,AI 引用的来源集合,日间重合度只有 0.34–0.42;

  • 即便把随机性参数调到最低,重复运行仍有 9–28% 的决策发生变化;

  • Google AI Overviews 两个月后的页面重叠率只有 18%,而传统自然搜索结果是 45%;

  • 在某个被研究的配置下,57.8% 的 ChatGPT 重复请求,根本没有触发联网检索。

最后这条对营销人尤其重要:你以为 AI 在网上现查,实际上大半时候它在凭记忆回答。这意味着,你在什么环境下测,测到的可能是两个完全不同的东西。

那它建议问多少次?

它提到有研究给出「每个问题重复 7–8 次」作为起点,但紧接着就写明:这个数字不是普适标准(它来自一个很小的查询样本、最多十次重复)。综述真正推荐的做法是:

重复测量,直到估计值周围的区间窄到足以支撑你要做的那个决策为止。

 够不够,取决于决策需要多窄的区间,而不是问了多少次

这是整篇文章的转折点:学术界给的不是一个次数,而是一个标准——够不够,不取决于问了多少次,取决于你要做的那个决策需要多窄的区间

这就把问题从「100 还是 5」,变成了「你要用这个数字干什么」。

第三件事:在中国,你得先问「在哪一层测」

现在进入最关键、也最少被讨论的一点。AI 可以从两个地方问:

一个是 API 直连。给开发者用的接口,可以写脚本、可以并发,几个小时就能跑完几万次。

另一个是 App 端。普通用户打开手机、在对话框里打字的那个入口。没有官方自动化接口,风控也严格,只能一次次问。

能够跑到 100 次的,主要是 API 这一层——这是可行性决定的,App 端根本承载不了这个量级。

在海外,这个设计是成立的。因为那边 API 和 App 背后是同一个模型、同一套知识,区别主要在于要不要联网检索。在 API 层大量采样、再用 App 层校准,逻辑通顺。

但这个前提,在中国不成立。

国内的主流 AI 应用,App 端普遍深度接入了自家的内容生态——社交平台、内容社区、自家的搜索体系。你问「这个价位有什么车值得看」,答案里很可能引用了社区讨论、平台笔记、自家搜索的结果。

但这些内容,在 API 层往往是拿不到的。

更进一步:微信公众号、小红书这类平台,对通用搜索引擎是封闭的,但对自家的模型是开放的。这意味着 API 层不仅少了实时检索,还系统性地缺失了国内最重要的一部分内容源。

所以在中国,如果你在 API 层问 100 次,你测到的是一个用户永远看不到的答案分布

打个比方。

这就像你要评估一家餐厅的出品,却跑去后厨看食材清单。

 食材清单核对得再精确,也答不了「顾客觉得好不好吃」

食材清单当然真实,你甚至可以抄写 100 遍、核对得一字不差。但顾客吃到的是成品菜——中间还隔着火候、摆盘和上菜速度。清单核对得再精确,也回答不了「顾客觉得好不好吃」。

在测量学里这叫效度问题——你测得准不准是一回事,你测的是不是你真正想知道的那件事,是另一回事。

而效度出了问题,是加多少次都补不回来的。抽样误差可以靠增加次数收敛;测错了对象,问一万次也还是错的。

这是第二个关键,也是更重要的那个:在中国市场,「在哪一层测」比「测多少次」重要得多。

那 5 次到底够不够?

先说实话:如果你要用 5 次去判定「某一道题上品牌算不算达标」,那是不够的。

我们算过:假设某道题的真实表现恰好卡在达标线上,用「5 次里中 4 次就算过」这种硬判定,会有超过四分之一的概率被误判为不达标。这对双方都不公平。

但这个结论有个前提——我们不该用采样次数去做单题裁决。

不管问 5 次还是 100 次,单题硬判定都是脆弱的。100 次的单题误差仍有 ±10 个百分点。所以这不是「次数不够」,而是判定规则用错了层级

 5 次是用来「测量」的,不是用来「裁决」的

正确的做法是:

· 每道题的 5 次结果,取频次均值作为「测量值」(比如 5 次中出现 4 次,记为 0.8),不做硬判定;

· 达标与否的判断,放在意图组和整体层去做。

一个覆盖数百道题、多个模型的诊断盘子,每题采 5 次,整体口径的置信区间约为 ±1.5 个百分点——这个精度,已经优于那家海外平台公开声称的话题级精度。

更实用的一个指标是:优化前后的变化,多大才算真的变了?

按我们的盘子测算,每题 5 次下,整体可见度 3 个百分点以上的变化可被稳定识别。而 3 个百分点以下的波动在业务上本就没有决策意义——模型改版、收录延迟带来的自然起伏就不止这个量级。

回到那篇综述的标准:区间窄到足以支撑决策,就够了。把精度做到 0.5 个百分点当然可以,但那是把预算花在了业务上用不到的地方。

所以我们的选择是:在对的地方,问够就好

把几件事放在一起,结论就清楚了:

第一,精度产生在汇总层,不在单题。单题永远有不确定性,100 次也一样。关键是把判定规则设在正确的层级。

第二,在中国市场,App 层才是真实环境。测量必须发生在用户真正看到的地方,否则精度再高也是无效的精度。

第三,够不够看决策,不看次数。学术界的标准是「区间窄到能支撑决策」,不是某个固定数字。

所以通察目前的推荐配置是:

在 App 端、按用户真实使用环境,每道题采集 5 次,取频次均值作为测量值,达标判定放在汇总层,并约定 3 个百分点的噪声下限。

这不是「我们只能做到 5 次」,而是在效度、精度和可执行性三者之间,目前能找到的最优解

如果某几道题直接挂钩合同验收、需要更高确定性,我们的建议不是把所有题都加到 100 次,而是分层加样:只给结果贴近判定线、最容易误判的那部分题加密——通常只占两三成。成本上升有限,却能把判定风险最大的部分显著改善。

 只给最容易误判的题加密,把资源花在会影响决策的地方

最后:把口径写在纸上,而不是靠默契

AI 的回答本来就是不稳定的。这是环境属性,不是谁的免责理由。

一个负责任的 GEO 服务方,能做的不是假装它稳定,也不是用一个更大的数字把客户镇住,而是把测量规则提前写清楚

  1. 在哪一层测(App 还是 API)

  2. 每题采几次,怎么取值

  3. 达标判定放在哪一层

  4. 多大的变化才算真的变了

  5. 基线日是哪天,复测多久一次

这几件事写在纸上,双方才有共同的尺子。否则优化做得再多,最后都会变成「你说涨了,我说是波动」的扯皮。

顺带一提,这个原则不止适用于采样次数。行业里流传的「GEO 能带来 40% 提升」,原意其实是:当五篇文档已经被放进 AI 的上下文之后,某种改写让目标文档的位置加权词数从 19.3 升到 27.2。它不代表 40% 的人会点击,也不代表被检索到的概率提升 40%。同一篇综述还发现:只优化正文内容,反而可能让文档在 top-20 的出现率下降约 9%。

每一个数字,都得先问清楚它测的是哪一段。

回到开头那场海外争论。它之所以吵不出结果,是因为双方都在证明自己的数字更准——但没有人先说清楚,这个数字是要拿来做什么决策的。

我们一直认为,GEO 行业当下最缺的不是更多的内容,也不是更大的采样数字,而是一套双方都认可、也都能验证的测量口径。

这也是为什么我们愿意把采样协议、判定层级和噪声下限,全部写进验收附件里——按什么标准收钱,就按什么标准验收。

 

通察科技 · TuneCha

我们提供 AI 可见度的诊断、内容资产与复测能力。

如果你正在评估 GEO 服务方,不妨用这几个问题去问一问:

你们在哪一层测?每题采几次?达标判定放在哪一层?多大的变化才算真的变了?

本文引用的学术数据来自 arXiv:2607.14035(2026 年 7 月,综述 45 项研究的批判性综述,预印本);厂商侧数据为其公开声明,未经第三方审计。

本文由通察科技 GEO 研究团队出品。