腾讯 GEO 和第三方 GEO,是互搏还是组合拳?

2026-09-08

1
0

腾讯 GEO 和第三方 GEO,是互搏还是组合拳?

腾讯发布 GEO 产品之际,一家独立第三方的观察与思考

通察 GEO 行业观察 · 第4期 · 2026 年 9 月

写在腾讯发布 GEO 产品之际

这几天行业里最热的一条消息:腾讯把内部用了一段时间的 AI 搜索可见度工具产品化,正式对外发布。

消息一出,我们收到不少客户和同行的询问。有人问这是不是意味着 GEO 这件事「被官方认证」了,也有人问得更直接——那第三方还有什么价值?

先说我们的态度:这是一件好事。一个由头部平台亲自下场背书的品类,比十家乙方喊一年都管用;它也把「AI 可见度需要被测量」这件事,从少数人的判断变成了行业共识。

但热闹之外,有些结构性的问题值得在这个时点说清楚。因为一个新品类刚成形的时候,规则怎么定、尺子谁来发,往往就在这几个月里决定了。

以下是我们作为一家独立第三方的观察与思考。有一部分是我们最近才想明白的,也包括一个我们自己先前判断错、现在要公开更正的地方。

先回答那个最直接的问题

这段时间被问得最多的一句话是:

「用腾讯的不是更好吗?」

这个反应完全可以理解。它背后有四个理由,前三个都说得出口:

 前三条是关于买起来省事,没有一条是关于测得准不准

大厂背书、采购流程好过;大概率便宜甚至免费;一个后台看完,省去多方协同。

但请注意——这三条讲的都是「买起来省事」,没有一条讲的是「测得准不准」。

而第四个理由通常不会被说出口:「用平台方的数据,将来出了问题不是我的责任。」

这是采购心理,不是专业判断。GEO 的钱最终要在预算会上自证,届时不会有人接受「数据是大厂给的」作为解释。

所以这篇文章想认真回答的是:这件事到底是互搏,还是可以配成一副牌?

我的结论是后者——但配牌的方式,和大多数人想的不一样。

互搏确实存在,但它不在你以为的地方

 既当运动员,又发尺子

真正的角色冲突,不发生在平台方和第三方之间,它发生在平台方自己身上。

一家公司同时做两件事:经营一个答案引擎,以及定义「怎么衡量在这个引擎里的表现」

这两件事天然打架。

如果它的优化建议真的很有效,那等于公开承认:自家的引擎是可以被操纵的。而一个答案引擎最核心的资产,恰恰是「用户相信这个答案是客观的」。

但更深一层的问题在这里——

它甚至不需要造假,就已经影响了整个行业的方向。

因为选择衡量哪些维度、不衡量哪些维度,本身就定义了所有人的优化方向。测提及率不测准确率,大家就去刷提及;测引用来源不测负面表述,大家就只做进攻不做防守。

一个行业的度量标准,不应该由被度量的对象单方面发布。这不是道德问题,是治理结构问题。

而第三方没有自家引擎要维护。它不需要证明任何一个引擎是客观的。这个位置的价值,恰恰来自它什么都不拥有。

先说清楚一件事:覆盖面不是壁垒

 当前未覆盖,不等于结构上做不了

平台方的工具目前监测五个主流通用大模型,当前不含社交内生搜索、AI 搜索浏览器、内容平台搜索。

而在美妆、母婴、汽车、本地生活这些品类里,真实的消费决策大量发生在内容平台,不在通用助手里。

这确实是个缺口。但我要特别说明一句,因为这一点很容易被讲过头:

这是「当前还没做」,不是「结构上做不了」。

内容平台搜索是公开生态——第三方能采集,平台方同样能采集,不存在什么技术障碍或准入壁垒;平台方自己也明确说过会根据市场情况持续扩展引擎。

所以覆盖面是时间差,不是护城河。任何一个把「我们测得比它多」当核心卖点的服务商,这个卖点随时可能在一次版本更新后失效。

那什么才是稳固的差异?不在「能不能测」,在「测得准不准」。

真正的分野:你测的是哪一层?

 引擎覆盖是广度问题,采集层级是效度问题

同一个模型,可以从两个地方拿数据:调 API,或者在 App 界面上采集。

在海外,两者差别不大,因为 API 和产品同源度高。

但在中国,这两层不是同一套东西。

国产模型的 App 端深度接入了自家的内容生态——某个助手背后连着社交平台的搜索和公众号内容,另一个背后连着短视频生态,还有一个背后是电商与浏览器体系。

API 调的是「模型」。App 调的是「模型 + 这家公司的内容护城河」。

两者的检索结果,不同源。

如果一个工具在 API 层采集,它拿到的数据会很漂亮——可脚本化、可并发、边际成本近零、每个问题跑上百次轻轻松松、数据还特别稳定。

但它测的是用户永远看不到的那一层。

这在测量学上叫构念效度失败——测错了对象。而测错对象这件事,采样次数再多也补不回来。跑一百次和跑一万次,测的都是同一个不相干的东西。

反过来,App 层采集又慢又笨:不能自动化、得人工采、受账号和地域影响、频次上不去。

但它测的就是用户真正看到的答案。

打个比方:评估一家餐厅好不好吃,你可以去后厨抄食材清单,也可以坐下来吃一顿。抄食材清单又快又标准化,抄一百遍都不累。但顾客的体验,只能靠吃那一顿知道。

越接近用户真实使用场景的测量,越可信。这是覆盖面追不平的那条线——它牵涉方法论、人力组织和成本结构,不是加个引擎就能补上的。

顺带说一句:目前平台方工具的采集层级并未公开。在它公开之前,「大厂出品」不构成对数据效度的任何保证。

为什么测量层不能外包出去

到这里,一个很自然的想法是:那就便宜的归便宜的——基线度量用平台方的免费工具锁住,把预算集中在执行侧,不是挺好?

我一开始也是这么想的。但这个方案有一个致命问题。

 测量是闭环的起点,也是数据回流的入口

GEO 的价值来自一个闭环,而不是五个可以拆开采购的环节:

测量 → 诊断 → 策略 → 内容执行 → 分发 → 回到测量

这个闭环真正的产物,不是某一次报告,而是每一轮迭代沉淀下来的内部数据:哪些问题曾经失分、改了什么、几周后哪些格子回升了、哪一类信源是真的被引用了。

这些数据只有在同一套体系内才能累积,也才能反过来去训练问题集和内容策略。

如果测量从平台方开始,中间跨到第三方做诊断与优化,再回到平台方验证,会出现三重成本:

成本

具体表现

接口与开放成本

依赖对方的数据开放程度;口径、字段、更新频率都不由你控制

SOP 与协同复杂度

两套系统之间人工搬运、对齐,每一轮迭代都要重来一次

归因断裂

最要命的一条——改动与结果之间的因果链被切断,无法回答「这次提升是我们做的哪件事带来的」

测量不是可以外包的第一步,它是闭环的起点。把它交出去,第三方就退化成了一个执行外包——而广告主失去的,是那套本该越用越准的迭代能力。

那平台方的数据放在哪儿?做校验方

 不是发尺子的人,是帮忙校准尺子的人

平台方的数据当然有独立价值:不同的采集层级、不同的动机结构。

但它不该承担度量层。它最合适的位置,是校验方。

怎么运作:

1. 第三方持续做测量与执行,闭环完整,数据不断回流。

2. 平台方工具定期做交叉校验(比如按月或按季),不参与日常度量

3. 两套数据的差异,对客户完全透明——一致的部分互相印证,不一致的部分必须给出解释

4. 校验的对象不只是分数,更是黑盒里的逻辑站不站得住:第三方说「这个改动带来了提升」,能不能在另一套独立数据里看到同方向的移动。

这样做有三个好处:

  • 闭环不断:测量仍在第三方体系内,数据继续回流迭代。

  • 可信度更高:结论经过独立来源的交叉验证,比任何单方自证都强。

  • 尺子由生态共同生产:规范不再由某一个大模型平台单方面发布,而是在「第三方测量 × 平台方校验 × 客户可见」的三方结构中形成。

平台方最好的位置,不是发尺子的人,是帮忙校准尺子的人。裁判员和运动员的角色,到这一步才真正分开。

对第三方来说,这也是一次立场表态:可以被校验,不接受被替代。

敢被校验,本身就是最强的可信度声明。

五个角色,正确的归属

 测量不外包,校验与验收都要独立

 注意第一行和最后两行。测量不外包,校验和验收都要独立——这三条立住了,中间的诊断和执行才有意义。

三个必问的问题:

01 · 你们的数据从 API 拿,还是从 App 拿?

中国这两层不同源。如果是 API 层,这份报告测的可能不是你的用户看到的答案,采样次数再多也不解决。

02 · 每个问题、每个模型采集几次?达标怎么判?

如果判定放在单个问题上、而采样次数又少,误判率会高得惊人——一道真实表现刚好卡在及格线上的题,可能有超过四分之一的概率被判成不及格,反过来也一样。比较稳妥的做法是:每个格子取频次均值,达标判定放到聚合层,单次跑数不作为判定依据。

03 · 谁来校验、谁来验收?

如果答案是「我们自己的后台数据」,那就是没有验收。

结论:让独立、合规、专业的第三方长起来

 被度量的一方,不该单独定义度量标准

互博是平台方自己要解的题——它既要当引擎,又在发尺子,这个矛盾不会因为工具做得好就消失。

对广告主来说,这不是一道单选题,是一副可以配的牌:

  • 第三方「测」:闭环完整、数据回流,且贴近用户真实场景

  • 平台方「校」:独立来源交叉验证,不参与日常度量

  • 客户「看」:差异完全透明,不一致的必须有解释

回到最初那个问题——「用大厂的不是更好吗?」我的答案是:用,但用在对的位置上。用它来校准尺子,而不是用它来发尺子。

一个健康的 GEO 生态,需要的是独立、合规、专业的第三方能够长起来。不是因为第三方更高尚,而是因为:

被度量的一方不该单独定义度量标准。这是所有成熟行业——审计、评级、临床试验——反复验证过的常识。GEO 还年轻,但没有理由重走一遍弯路。

回到开头。腾讯这次下场,我们的态度没变——这是好事。它把纯监测这件事的价格打了下来,把品类的认知度抬了上去,也逼着所有服务商回答一个更本质的问题:

除了给一个分数,你还能给什么?

本文观点基于公开资料与行业实践整理。文中涉及的采样精度与判定规则讨论,参考了生成式引擎优化领域的公开学术综述;具体数字口径以各自原始出处为准。不构成投资建议。

本文由通察科技 GEO 研究团队出品。