做GEO,拿一张AI回答截图就够了吗?

2026-08-20

7
0

一场GEO汇报开到一半,屏幕上出现了一张AI回答截图。

品牌名被红框圈住,旁边还有一句挺漂亮的推荐语。会议室里的人凑近看了看,心里大概都会冒出同一个念头,成了?

先别急。

这张图很可能是真的。麻烦在于,它只记录了某一次提问、某一次生成,以及某一刻刚好出现的答案。拿它证明GEO长期有效,有点像抽卡抽中了SSR,马上宣布这个卡池出货率百分之百。

那些没有截下来的回答去哪了

模型回答会变。换个模型版本,改几个字,带上前一轮对话,打开联网,再问一次,结果都可能不同。OpenAI的开发者文档也提醒,模型生成具有非确定性,需要持续测试和评估。[2]

所以我看到效果截图时,通常先把真假放在一边,问几件很朴素的事。

这是什么模型,在哪个入口测的?测试时有没有联网,有没有上传品牌材料?同一道题问了几次?品牌出现了几次,又消失了几次?

如果一共问了二十次,只展示最好看的那一次,截图没有造假,结论却已经走远了。

还有一种更省力的做法。题目里直接塞进品牌名,再拿回答证明模型会推荐这个品牌。模型当然可能接着聊,就像你问朋友「这家店是不是很好吃」,对方顺着你的话说几句。可这和他周末主动带人去吃,完全是两种分量。

出现了,也可能是在劝退

品牌名出现在回答里,听上去是好事。仔细看却未必。

模型可能把它列进候选,也可能放在第一位推荐,还可能提醒「这款产品更适合某类人」「购买前要留意某项风险」。如果报告只数品牌名出现了几次,夸奖和劝退都会被装进同一个「推荐率」。这账算得太轻松了。

GEO早期研究建立的GEO-bench包含1万条查询、25个领域和9类任务,评估时会看引用位置、相关文字篇幅和主观影响等多个维度。[3] 学术评估都不敢只数名字,商业验收更不该偷这个懒。

一份讲得清楚的报告,至少应拆开看提及率、推荐率、首选率、引用率和情感倾向。名字露面是一件事,模型愿不愿意把品牌放进关键建议里,是另一件事。

截图之外还有一整卷结果

别只收高光照片,要看整卷胶片

我们可以把一次GEO测试想成拍一卷胶片。交付方只拿出最好看的一张,当然赏心悦目。企业真正花钱买的,却应该是整卷结果。

完整问题清单要在测试前确定。模型、入口、日期、联网状态要留下记录。成功样本和失败样本都得交出来,完整上下文、分享链接或原始日志也要保留。最好再让客户或第三方按同样条件复测一次。

这听上去麻烦,却能省掉后面更大的麻烦。品牌究竟在哪些问题上容易被看见,在哪些地方总是缺席,模型引用了谁,又为什么信了它,这些才是团队下一步能拿来工作的东西。

截至2025年6月,我国生成式人工智能用户规模已达5.15亿人,其中80.9%的用户会用生成式AI回答问题。[1] AI回答正在进入真实的消费决策,企业认真验收并不过分。

下次再看到一张漂亮截图,可以欣赏,也可以高兴。然后把鼠标往下滚一滚。

我们想看的,是截图后面那十九次。

参考资料

[1] 新华网《我国生成式人工智能用户规模达5.15亿人》,2025-10-18。数据引自中国互联网络信息中心《生成式人工智能应用发展报告(2025)》 https://www.xinhuanet.com/fortune/20251018/95ddc306f29f494fb188ed41ad8e5cca/c.html

[2] OpenAI Developers, Text generation https://developers.openai.com/api/docs/guides/text-generation

[3] Aggarwal, P. et al., GEO: Generative Engine Optimization, arXiv:2311.09735,KDD 2024 https://arxiv.org/abs/2311.09735

数据说明 上述数字反映对应报告或实验的特定时间、样本和条件,不代表所有GEO项目均能取得相同结果。

说明 本文讨论一般行业现象与风险识别方法,不针对任何具体企业、媒体或服务商作事实判断,也不构成法律意见。

本文由通察科技 GEO 研究团队出品。