数字营销

45 篇研究给 GEO 泼了盆冷水:结论不是别做,而是别急

Leo Wang July 30, 2026
45 篇研究给 GEO 泼了盆冷水:结论不是别做,而是别急

45 篇研究给 GEO 泼了盆冷水:结论不是别做,而是别急

2026 年 7 月 15 日,arXiv 发布了一篇批判性综述《Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026)》。该研究梳理了 2023 年 11 月至 2026 年 7 月间的 45 项 GEO 研究,得出一个不太讨喜的结论:目前没有任何一种被评审过的方法,能在不同 AI 平台上稳定提升可见度、流量或商业结果 [1][2]。综述还指出,部分以 GEO 为目的的改写,会让页面被 AI 检索到的概率最多下降 16%——这是该研究观察到的下降上限,而不是普遍结果 [2]

这项综述并不是在宣判 GEO 无效。它真正提醒行业的是:别再把 GEO 包装成一套几周见效、跨平台通用的固定公式。

GEO(Generative Engine Optimization,生成式引擎优化)指通过优化网站技术结构、内容表达、品牌实体信息和站外证据,提高品牌在 ChatGPT、Google AI Overviews、Perplexity、Claude、Copilot 等生成式 AI 回答中被检索、理解、引用和推荐的概率。 它是一项概率优化工程,而不是一套能保证排名的确定性规则。

本文围绕这份综述,说明四个结论:

  1. 模型厂商没有公布统一规则,GEO 要以公开信息和多平台实测为基础。 企业能做的不是套用固定公式,而是通过技术、内容、实体和站外信号持续提高胜率。
  2. GEO 效果存在波动,长期监测不是附加项,而是必要组成。 固定问题库、多轮测试和季度复盘,比一次测试或一张截图更有判断价值。
  3. AI 搜索越商业化,自然引用的长尾价值越突出。 付费渠道争夺头部需求,GEO 则用可复用的内容和信任资产覆盖大量细分问题。
  4. GEO 的回报来自持续积累,不来自一次改稿。 技术基础、内容资产、品牌实体和外部信任需要按季度建设,不能用几周内的引用涨跌判断成败。

下面先厘清这 45 篇研究究竟证明了什么,再依次展开这四个结论。

---

这 45 篇研究,真正质疑的是什么?

值得关注的不是「GEO 到底有没有用」,而是现有研究究竟证明到了哪一步。

综述发现,很多实验会先把某篇内容放进模型可用的材料中,再观察改写之后模型是否更愿意引用它。这类实验能够说明:当 AI 已经拿到你的内容时,表达方式会影响它如何使用和引用这段内容。

但真实的 AI 搜索还多了一个前提:页面必须先被抓取、进入检索范围,并在大量候选内容中被选中。综述指出,现有研究对这一环节的证明要弱得多,对点击、线索和收入等长期业务结果的证明则更少 [2]

AI 可见度链路企业真正关心的问题现有研究能说明什么
先被找到页面能否被抓取,并进入 AI 的候选信息范围?相关证据仍有限,真实结果会受平台、查询和检索架构影响
再被引用AI 拿到内容后,是否愿意采用你的观点、数据或产品信息?证据相对更充分,清晰具体的表达会影响引用方式
形成业务结果引用能否进一步带来访问、线索和收入?长期、稳定的因果证据仍然不足

AI 可见度的这三步不能混为一谈。一次改写让引用措辞发生变化,只能说明内容在「已经被 AI 看到」的情况下更容易被使用;它并不能自动证明页面在真实搜索中更容易被找到,也不能直接等同于业务增长。

综述中 16% 的检索下降,同样不意味着「做 GEO 会伤害网站」。这个数据说明的是:如果只追求让文案看起来像标准答案,可能会删掉产品场景、专有数据和差异化信息,反而降低内容在检索阶段的辨识度。 GEO 不能只优化「好不好引用」,还要同时兼顾「能不能被找到」和「是否对业务有价值」。

---

为什么没有统一的 GEO 官方规则:各家 AI 平台机制并不相同

当前没有任何一家模型厂商公开完整的检索、引用和推荐规则。Google 为自家生成式搜索提供过公开指南,整体仍延续 SEO 的基本原则;但在其他平台上,公开信息明显更有限。例如,Anthropic 尚未完整披露 Claude 使用搜索与来源的全部机制 [4]。Claude、ChatGPT Search 和 Google AI Overviews 的产品架构也不相同,把一个平台上的经验原样复制到另一个平台,结果自然很难稳定 [5]

各平台的检索方式还会持续变化。有从业者通过人工对比搜索结果,发现 ChatGPT 的检索行为发生变化,并据此修订了原有的架构判断;这个变化并不是来自厂商公告,而是来自持续测试 [6]。这意味着,任何针对单一版本总结出的技巧,都可能随着平台更新而失效。

各平台偏好的信息来源也不一样。据 BrightEdge 对其追踪查询样本的分析,Google AI Overviews 出现 YouTube 来源的查询量约为 ChatGPT 的 30 倍,而 ChatGPT 出现 Reddit 来源的查询量比 Google AI Overviews 高约 55% [7]。行业分析也观察到,Copilot 更容易接入 LinkedIn 及微软生态中的内容 [8]

部分模型还更倾向推荐与自家生态相关的品牌和内容。据 5W 发布的两轮基准测试,ChatGPT 推荐 OpenAI 的频率约为其他 AI 引擎的两倍 [9]。这不是一句抽象的「模型有偏好」,而是一个很现实的提醒:品牌在 ChatGPT、Google、Claude 或 Copilot 上面对的竞争环境并不相同。

也正因为规则不公开、结果会波动,任何「短期内保证某个品牌词在 AI 回答中做到第一」的承诺都不具备技术依据,属于夸大宣传——生成式回答本身没有固定排名位次,更不存在可被外部锁定的第一名;而靠短期堆量、低质内容冲结果,还会稀释品牌的专业信息密度,损害品牌在 AI 与用户端的长期信任。

GEO 的方法论因此不应建立在「破解某个模型」的承诺上,而应建立在公开资料、持续测试和概率优化之上。更稳妥的做法是:

  • 先打牢技术基础。 确保重要页面可抓取、核心信息直接出现在 HTML 中,并正确处理 robots、canonical、结构化数据和站内链接。
  • 让内容清楚、具体、可验证。 明确回答问题,保留产品参数、使用场景、原创数据和来源,不要为了追求简短而抹掉差异化信息。
  • 统一品牌实体。 官网、社交媒体、媒体报道、目录和合作伙伴页面中的品牌名、产品名与关键事实保持一致。
  • 积累站外证据。 用户评价、行业媒体、专业社区、合作伙伴和权威数据库,能帮助 AI 从品牌官网之外验证你的主张。
  • 分平台测试。 在 ChatGPT、Google AI Overviews、Perplexity、Claude 和 Copilot 上分别观察,不把单一模型的结果当成行业通用结论。

arXiv 上另一项电商 GEO 测试(E-GEO)提供了有价值的补充:在加入基础的 in-prompt 防御后,系统获得的提升更多来自真实内容质量,而不是操纵性技巧 [10]。长期来看,清晰、可信、有独立信息增量的内容,比格式投机更能适应平台变化。

---

为什么 GEO 效果会波动:监测必须做成长期机制

GEO 效果的波动并不完全来自执行质量。平台会更新检索管线,默认模型会变化,同一个问题多次生成也可能出现不同答案;不同模式调用的来源也不一样,例如快速回答可能更多采用社区内容,深度研究模式则可能增加官方文档和专业来源的比重 [11]

一张「优化前后」的对比截图,因此不足以证明 GEO 效果。它可能来自内容调整,也可能只是模型随机性、平台更新或搜索结果变化。真正有效的监测,需要在相对固定的条件下反复观察。

监测动作具体做法能解决什么问题
建立固定问题库按品牌词、品类词、场景词、对比词和购买决策词分组保证不同周期测试的是同一批需求
固定平台与测试频率每周或每月在同一组 AI 平台执行便于识别趋势,而不是比较不同样本
同一问题多次测试记录多轮回答,不用单次结果下结论降低生成随机性带来的误判
拆分记录结果分别记录品牌提及、链接引用、推荐位置和完全缺席判断问题发生在「没被找到」还是「找到后没被采用」
标注外部变化记录模型升级、网站改版、内容发布和重大公关事件避免把平台变化误算成优化效果
按趋势复盘观察月度、季度的覆盖率和引用率变化判断策略是否持续提高整体胜率

监测的价值,不是承诺每次改动都带来上涨,而是让企业知道:哪些主题开始获得覆盖,哪些平台仍然缺席,哪些内容更新真正提高了被引用的概率。

GEO 因此更适合按季度评估。周度数据可以用来发现异常,月度数据可以用来调整动作,季度数据才更适合判断方向。

---

AI 搜索走向商业化后,自然引用为什么更适合承接长尾

AI 产品走向广告和交易变现几乎是必然趋势。据 Tech Insider 报道,ChatGPT 于 2026 年 2 月上线广告,广告出现在全球约 26.5% 的回复中,美国市场约为 49%;这些比例来自第三方观测,并非 OpenAI 官方披露 [12]。行业分析普遍预期,AI 答案页会同时存在赞助位、购物模块和自然引用,形成「付费曝光 + 自然推荐」的双层结构 [13]

AI 搜索的这种付费化,对品牌来说并不陌生。搜索广告的发展已经证明:越接近交易、竞争越激烈的头部需求,付费流量通常越贵。品牌可以购买一部分核心曝光,但很难为用户提出的每一个细分问题持续出价。

自然引用的价值,恰恰在长尾:

  • 用户会用大量具体问题描述场景、预算、功能和顾虑,这些需求很难被有限的广告关键词完全覆盖。
  • 一篇高质量内容可以同时回答多个相近问题,新增一次自然引用不需要再支付一次点击费用。
  • 技术、内容、实体和站外信任一旦形成资产,会持续支持后续页面和新产品被 AI 理解。
  • 当竞品购买付费位置时,品牌仍有机会凭借可信内容进入答案正文,形成另一条触达路径 [14]

商业化也可能改变自然引用的分布。据 Built In 报道,广告上线后,品牌相关查询中的引用一度下降约 41%,到 2026 年 3 月前后逐步恢复,来源结构也更偏向品牌官网和评测内容 [15]。这一变化说明,自然可见度不会静止不变,品牌需要提前建设,也需要持续跟踪。

GEO 并不是 AI 广告的替代品。更现实的组合是:付费渠道争夺高价值、强交易意图的头部需求;GEO 用可复用的内容与信任资产,覆盖规模更大、问题更细的长尾需求。 从长期获客成本看,后者是值得尽早布局的性价比渠道。

---

GEO 的回报来自长期积累,而不是一次改稿

如果平台规则不完全公开、效果存在波动,而主要机会又来自长尾,那么 GEO 就不能被当成一次性的文案优化项目。

真正能够跨越模型更新的,是一组不断增厚的品牌资产:

  • 技术可读性: AI 爬虫能够访问页面,核心信息不依赖复杂脚本才能显示,结构化数据与页面事实保持一致。
  • 内容资产: 围绕用户真实问题持续提供清晰答案、原创经验、产品数据、对比依据和使用边界。
  • 实体资产: 品牌、产品、创始团队、类别和关键属性在不同渠道保持一致,减少识别歧义。
  • 站外信任: 第三方报道、专业评测、用户讨论、合作伙伴和行业资料共同提供外部佐证。
  • 监测资产: 保留问题库、平台结果和改动记录,逐步形成品牌自己的 AI 可见度基线。
时间阶段建设重点更合理的验收方式
第 1 个季度完成技术审计、建立问题库和可见度基线,修复高优先级抓取与结构问题关键页面是否可访问、可解析;监测体系是否稳定运行
第 2 个季度补齐核心主题内容,统一品牌实体,增加可验证事实与外部来源重点主题的品牌提及率、引用覆盖率是否改善
第 3 个季度及以后扩展长尾内容、加强站外分发,并根据平台差异持续迭代多平台覆盖是否扩大;自然引用是否开始贡献访问与转化

GEO 项目第一个季度没有出现引用量暴涨,并不等于失败。早期更值得检查的是:AI 是否更容易访问核心页面,品牌信息是否更一致,重点问题是否有内容承接,企业是否已经拥有一套可重复的测量方法。

技术、内容、实体和监测这些基础建设完成后,引用增长才有稳定发生的条件。GEO 的目标不是押中一次平台偏好,而是持续增加品牌在更多问题、更多模型和更多场景中被选中的机会。

---

常见问题(FAQ)

45 篇研究是不是证明 GEO 没有用?

这 45 篇研究并不证明 GEO 无效。综述的结论是:目前没有单一方法被证明能在不同 AI 平台上稳定带来可见度、流量和商业增长 [1][3]。它质疑的是过度确定的效果承诺,而不是企业提升 AI 可见度这件事本身。

为什么有些 GEO 改写会让检索率下降 16%?

综述观察到的 16% 是下降上限,可能的原因是:内容为了变得更像「可直接引用的答案」,删掉了具体场景、独特数据和语义差异,导致检索系统更难判断它与特定问题的相关性 [2]。GEO 优化需要同时兼顾可发现性、可引用性和业务价值。

OpenAI、Google 或 Anthropic 有没有统一的 GEO 官方指南?

目前没有覆盖所有 AI 平台的统一方案。Google 针对自家生成式搜索提供过公开建议,但其他平台披露的信息有限,产品架构和来源偏好也各不相同 [4]。企业应以公开资料为基础,结合多平台实测持续优化。

同一套 GEO 方法能不能用于所有 AI 平台?

基础能力可以共用,例如技术可读性、事实准确、实体一致和第三方佐证;但渠道策略需要分别制定。Google、ChatGPT、Claude、Perplexity 和 Copilot 对来源与内容形态的偏好不同,测试和监测也应按平台拆分 [7][8]

AI 搜索有了广告,为什么还要做自然引用?

广告更适合覆盖高价值头部需求,自然引用更适合承接数量庞大、表达分散的长尾问题。内容与信任资产可以被重复使用,不需要为每一次曝光单独付费,因此更有长期成本优势 [12][13]

多久能看到 GEO 效果?

GEO 建议按季度规划,不按几周承诺。第一个季度先完成技术基础、内容补齐和监测基线;之后再观察多平台提及率、引用覆盖率、AI 转介流量与业务转化的趋势。具体速度取决于网站基础、行业竞争和平台变化。

---

核心结论

  • 45 篇研究质疑的是 GEO 的短期确定性承诺,而不是 AI 可见度建设本身 [1]
  • GEO 是概率优化:通过技术、内容、实体和站外信号,提高品牌被找到、理解、引用和推荐的机会。
  • 综述观察到的 16% 检索下降是上限值,说明只优化「可引用性」可能损害「可发现性」 [2]
  • 不同模型的架构与来源偏好不同,任何方法都应基于公开信息、多平台实测和持续复盘。
  • 单次截图无法代表效果,企业需要固定问题库、多轮测试,并用季度趋势判断策略。
  • AI 搜索商业化后,广告会争夺头部需求,自然引用更适合覆盖长尾,并形成长期成本优势。
  • GEO 的真正壁垒不是一次改稿,而是持续积累的技术基础、内容资产、品牌实体、外部信任和监测数据。

这份 arXiv 综述给行业泼的冷水很有必要。它让企业放下「几周见效」的幻想,也让 GEO 回到更务实的位置:不是寻找一条永远有效的捷径,而是持续提高品牌进入 AI 答案的概率。

当越来越多流量入口被广告和平台规则重新分配时,能够被 AI 稳定理解、被第三方持续验证、被用户长期需要的品牌资产,才是更值得投入的确定性。

---

GEO 不是一场短跑,而是一项需要长期建设的品牌基础设施。

Innflows 帮助企业审计技术可读性、内容结构、实体一致性与 AI 可见度,并通过持续监测,把 GEO 变成可衡量、可复盘、可积累的增长工程。

---

参考来源

[1] - Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023–2026) — arXiv:2607.14035(2026 年 7 月 15 日)

[2] - Survey of 45 studies finds GEO rewrites can cut a page's AI retrieval 16% — PPC Land

[3] - AI Update, July 24, 2026 — MarketingProfs

[4] - How GEO Works — Opactor

[5] - How to Get Visibility on Claude in 2026 — GenerateMore

[6] - LLM Retrieval Architecture — geo-seo-audit (GitHub)

[7] - How Google AI Overviews and ChatGPT Use Reddit Differently — BrightEdge

[8] - Different AI platforms, different sources — Marketing-Interactive

[9] - ChatGPT Recommends OpenAI 2x More Than Other AI Engines Do — PR Newswire

[10] - E-GEO: A Testbed for Generative Engine Optimization in E-Commerce — arXiv:2511.20867

[11] - You're optimizing for one type of AI Search — Pepper Content

[12] - ChatGPT Ads Hit 49% of US Replies — Tech Insider

[13] - AI Engine Monetization in 2026 — CapConvert

[14] - Sponsored vs Cited: When Competitors Buy ChatGPT Ads — Topify

[15] - How to Make Brand Content More Citable in AI Search — Built In

Related Articles

AI 搜索被正式纳入监管:企业的 GEO 该怎么调整?

AI 搜索被正式纳入监管:企业的 GEO 该怎么调整?

2026 年 8 月 31 日,欧盟委员会依《数字服务法》(DSA)把 ChatGPT 认定为超大型在线搜索引擎(VLOSE),同日把 Reddit 和 Roblox 认定为超大型在线平台(VLOP).对企业来说,重点不是"又有监管了",而是一个判断依据:监管瞄准的是"用未披露的商业手段改变答案",不是"让真实信息更容易被找到"。 这两类做法过去混在同一个预算里,现在必须分开。

Read
AI 时代,Innflows助力出海品牌—通过GEO构建品牌护城河,布局长战线

AI 时代,Innflows助力出海品牌—通过GEO构建品牌护城河,布局长战线

2026 年 9 月 4 日下午,广州谷歌跨境DTC系列培训暨"广州优品进东盟":出海品牌—品牌护城河构建与长战线布局. 在谷歌加速中心(广州)顺利举办。活动由广州外经贸企业协会主办,是该系列培训的最新一期,聚焦出海企业品牌化发展的核心需求,围绕品牌认知体系搭建、GEO 核心解析、课程复盘三大方向展开。在会上,Innflows 分享了一件正在发生的事:海外买家的决策起点,已经从搜索框挪到了提问框。

Read
ChatGPT 广告将扩到 31 个欧洲市场:付费位覆盖不到的长尾,才是 GEO 的主战场

ChatGPT 广告将扩到 31 个欧洲市场:付费位覆盖不到的长尾,才是 GEO 的主战场

2026 年 8 月 18 日,OpenAI 发布公告:ChatGPT Ads 将在"下周"扩展到 31 个欧洲国家,包括德国、法国、西班牙、意大利、瑞典、挪威、丹麦、荷兰和奥地利。这是该广告业务自 2026 年 2 月在美国试点以来规模最大的一次扩张。OpenAI 用产品设计和公开原则,主动把广告限制在一小块范围里:只对部分订阅层可见、只在部分话题上可投、只在有广告主出价时出现、多个广告主竞争时还只先展示一条。剩下的绝大部分提问场景——那些具体、细分、带着场景和顾虑的长尾问题——付费位根本覆盖不到。

Read