做GEO,猜中用户的问题之后呢?

2026-08-26

8
0

有家长问孩子「明天考试会考什么」。孩子刷刷写出十道题,押中了八道。

很厉害。可他一道也不会做。

这大概是我听到「我们掌握真实用户Query,所以更懂GEO」时,脑子里最先蹦出来的画面。知道大家会问什么,当然有价值。可用户最终看到的是答案,品牌最后要面对的也是答案。

押中考题和答对考题是两张卷子

问题库能帮你找到考场

消费者很少照着产品手册提问。他们会问「三十万元买什么车」「第一次带父母出国去哪儿」「哪款扫地机器人不容易缠头发」。这些话不整齐,也不照顾品牌的产品分类,但它们离真实选择很近。

输入法、浏览器、搜索、内容平台、客服和CRM,都可能留下有用线索。它们能帮品牌发现用户在意什么、用什么词、卡在哪一步。

这份洞察值得买单。

边界也要讲明白。输入法里的文字后来发给了微信、邮件还是DeepSeek,数据未必知道。用户打开过AI网站,也不等于浏览器就能看见完整对话。传统搜索词和大模型里一问再问的长对话,也不是同一种东西。

公开对话接口通常接收调用方主动提交的 messages 数组。[2] 服务商能看见自家应用收到的请求,不代表它天然拥有豆包、DeepSeek、腾讯元宝和通义千问里所有人的真实提问。要说自己掌握后者,就得拿出可核验的产品集成、授权范围或数据合作。

真正难的是把答案改对

一套问题库主要回答「该测什么」。做GEO还要继续追下去。

模型为什么漏掉品牌?它参考了哪些网站?官网参数和媒体文章有没有打架?品牌的优势有没有被写成模型容易理解、也容易核验的事实?旧价格和旧说法为什么还在答案里?

这些活儿没那么像一句广告语,更像排水管。你得一段段找堵点,手上还会沾灰。

如果服务商掌握问题、自己挑测试题、自己做内容,再自己宣布成绩,闭环就容易越跑越顺。顺到最后,题目全是品牌本来就容易答对的。

自选题闭环和陌生题盲测

看看下面三道题。

· 适合商务接待的MPV有哪些?

· 某品牌的MPV适合商务接待吗?

· 某品牌某车型有哪些优势?

第一道题看模型会不会主动想起品牌。后两道已经给了线索,更适合检查品牌信息有没有被理解准确。三道题都能测,却不能混成一个数字。把它们放在一起算「推荐率」,就像把开卷考试和闭卷考试放在同一张成绩单上。

GEO-bench用了1万条查询,覆盖25个领域和9类任务,还通过多个随机种子重复实验、报告平均结果。[3] 商业项目未必需要照搬学术基准的规模,但思路很值得借。别靠一道自选题给自己发奖状。

留一叠谁都没看过的题

我更愿意相信这样的测试。

问题集在优化前锁定一部分。服务商提供一部分,客户和第三方再补一部分。最后留出一叠盲题,参与内容优化的人事先看不到。品牌认知、品类发现、竞品比较、风险核查分开统计,成功与失败结果一起交付。

数据来源也要能交代。它来自什么场景,是完整问题还是聚合趋势,覆盖哪些人群,有没有取得必要授权,脱敏和保存怎么处理。《生成式人工智能服务管理暂行办法》对数据合法来源和个人信息处理都有明确要求。[4]

好问题确实稀缺。它能让品牌少走弯路,也能暴露出会议室里想不到的需求。

可押中题目只拿到了一半分数。

剩下那一半,要在陌生题上把答案做对。

 

参考资料

[1] 新华网《我国生成式人工智能用户规模达5.15亿人》,2025-10-18 https://www.xinhuanet.com/fortune/20251018/95ddc306f29f494fb188ed41ad8e5cca/c.html

[2] DeepSeek API Docs, Create Chat Completion https://api-docs.deepseek.com/api/create-chat-completion

[3] Aggarwal, P. et al., GEO: Generative Engine Optimization, arXiv:2311.09735,KDD 2024 https://arxiv.org/abs/2311.09735

[4] 国家互联网信息办公室等《生成式人工智能服务管理暂行办法》,2023-07-13 https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm

说明 本文讨论一般行业现象与风险识别方法,不针对任何具体企业、媒体或服务商作事实判断,也不构成法律意见。

本文由通察科技 GEO 研究团队出品。