AI与机器学习

57% 的 AI 被引域名只出现了一个月:一次被引用,不等于持续可见

Leo Wang August 20, 2026
57% 的 AI 被引域名只出现了一个月:一次被引用,不等于持续可见

57% 的 AI 被引域名只出现了一个月:一次被引用,不等于持续可见

先给结论: Somantra 对澳大利亚保险品类做了一次纵向追踪。样本包含 2,437,107 条引用记录、28,725 个域名,覆盖 2025 年 11 月至 2026 年 7 月之间的七个观察月。结果是,57.2% 的域名只在其中一个月出现过,能在七个观察月里持续出现的只有 2.7% [1]

这不代表 57.2% 的页面从此永远消失。它说明的是另一件事:“拿到过一次 AI 引用”这个指标,远远不足以证明品牌已经建立了持续可见度。

一次引用是一件事。能不能留下来,是另一件事。

---

先别急着渲染“内容墓场”,这项研究到底测了什么

这项研究的价值,在于它没有只截一张某天的可见度快照,而是沿时间观察引用有没有再次出现。研究范围如下 [1] [2]

项目研究口径
引用记录2,437,107 条
独立域名28,725 个
观察时间2025 年 11 月至 2026 年 7 月之间的七个观察月
市场澳大利亚保险
AI 产品ChatGPT 搜索、Google AI Overviews
只在一个月出现的域名57.2%
七个观察月均出现的域名2.7%

最容易被标题带偏的地方有两个。

第一,57.2% 统计的是域名,不是单篇页面。 一个域名可能在那个月只拿到一次引用,也可能拿到很多次。公开摘要没有披露足够信息,让我们计算具体 URL 的回归率,也没有给出 ChatGPT 与 Google 各自的留存差异。

第二,“再也没有被引用”必须带上时间边界。 准确说法是:这些域名在七个观察月中只出现于一个月,此后直到 2026 年 7 月都没有再次出现。研究没有观察 2026 年 7 月之后发生了什么。

所以,“57% 的内容永久死亡”不是这项研究支持的结论。

---

为什么“被引用过”是一个很弱的成功指标

一次引用至少经过三步:AI 发起搜索、检索到页面、把页面选进某一次回答的来源列表。下一次运行,这三步都可能发生变化。

一篇 2026 年 4 月提交的信息检索预印本,专门讨论了这个测量问题。作者指出,AI 回答会随运行次数、prompt 表达和时间变化,因此单次观测并不可靠;更合适的做法,是重复测量,并把可见度看成一个分布,而不是一个固定点位 [5]

这会直接改变看板上的“好消息”该怎么读:

  1. 出现过: 某个域名或 URL 是否至少被引用一次?
  2. 能复现: 同一组问题重复测量时,它是否再次出现?
  3. 能留存: 跨多个周期,它是否持续在场?
  4. 能恢复: 消失之后,它有没有重新回来?
  5. 有贡献: 它只是挂在来源列表里,还是实际支撑了回答?

Somantra 的研究主要触及前三层。它没有测量引用是否带来品牌提及,也没有证明引用改变了最终推荐。

这也是为什么“本月新增引用数”不能单独作为 GEO 成绩。新增很多,可能只是长尾噪声;总量没变,也可能是稳定核心正在流失,同时被一批一次性来源填平。

---

57% 只出现一个月,为什么另一份研究却说 96.8% 很稳定

因为 AI 引用可以同时存在两个区域:核心很稳,边缘很吵。

BrightEdge 对五个 AI 引擎、九个行业做过一次周度对比。在它测量的那一周,96.8% 的被引域名没有变化。但在发生变化的约 3% 域名里,87% 是下降;而且大多不是缓慢下滑,而是从某个 prompt 的来源列表里直接消失 [4]

两项研究的样本、周期、行业和指标定义都不同,不能把数字直接相减。但放在一起,能看出一个很有用的结构:

引用区域数据呈现出来的特征对看板的要求
稳定核心一小批来源在短周期里可以非常稳定单独计算重复出现的引用占比
波动边缘一次性和临界来源可能短暂进入,随后消失不把每条新增引用都算成持续增长

BrightEdge 还发现,高引用量域名通常拥有更大的波动边缘,不过在它测量的那一周,这部分一般只占头部域名引用份额的约 5% [4]

问题就出在平均数上。一个总可见度分数,会把稳定核心和波动边缘揉在一起。曲线看着平,核心可能正在缩水;曲线上升,也可能只是涌入了一批下个周期就消失的新来源。

---

对比页和 FAQ 真的更容易留下来吗

目前只能说存在相关性,因果还没有被证明。

在 Somantra 的澳大利亚保险数据里,带有对比、FAQ、折扣或价格结构的页面,在持续引用组中的出现率,约为一次性引用组的两倍。标为“完整指南”的内容,在只出现一个月的域名中则多出 3.5 倍 [1] [2]

另一项 DeltaV Digital 研究提供了部分呼应,也给这条结论踩了刹车。它在 90 天里追踪了五个引擎、八个行业的 21,075 条回答,分析其中 25,337 次引用。对比页的“每次被检索后产生多少引用”最高,达到 1.87,比全部页面的平均值 1.29 高 45%;但对比页只占总引用的 4.1% [3]

更重要的是,不同行业吃的内容完全不同:

行业样本引用占比最高的页面类型DeltaV 报告占比
B2B 技术服务榜单页61%
本地医美服务首页55%
医疗健康信息文章54%
高等教育项目页53%

所以,真正可执行的结论不是“以后别写长文,全改对比页”。

更稳妥的读法是:结构清楚的对比内容,在已有数据里表现出较高的检索转引用效率;但每个行业都有自己的引用指纹。 一篇长文也可以包含边界清楚的问答、对比表和自包含段落。公开研究没有把篇幅单独拿出来做受控实验。

内容团队该问的,是页面里有没有能够反复回答真实问题的段落,而不是先问文章够不够长。

---

一条引用为什么会消失

现有研究能指出几个故障点,但还拼不出一套完整的因果模型。

同一个问题,本来就可能生成不同答案

生成式回答具有概率性。同一个 prompt 重复运行,品牌、排序和来源都可能变化。学术测量框架因此强调重复采样 [5]。一次没出现,可能只是本轮波动;连续多个周期都消失,才更像需要处理的问题。

同一个 ChatGPT,模式不同也会换来源

Semrush 与 Growth Memo 用 100 个 prompt、20 条买家旅程测试了不同推理模式。报告称,minimal 与 high reasoning 两种模式之间,被引域名的重合率只有 25.6%,高推理模式还会发起更多搜索 [6]。这是厂商研究,但它提醒了一件事:只写“ChatGPT 可见度”,口径可能已经太粗。

页面可能只站在波动边缘

BrightEdge 的数据表明,变化更集中在稳定核心之外。一个页面可以在某次回答里足够相关,却没有相关到不可替代。下一轮检索到更具体的来源,它就可能被换掉 [4]

页面周围的证据环境变了

竞争对手发布新内容、官方来源更新、页面事实过期、抓取权限变化、canonical 或 robots 配置调整,都可能影响结果。这些是排查方向,不是已经被本文来源逐项证明的原因。要解释某条引用为什么消失,必须回到具体的 prompt、引擎、替代来源、页面和时间点。

---

一张真正有用的引用看板,应该多出哪些指标

要测留存,比较单位必须固定。prompt、引擎、模式、地区和采样频率如果同时变化,月度差异反映的可能是测试变了,而不是品牌可见度变了。

下面这套指标是一种实用的运营框架,不是 AI 平台公布的排名因子:

指标工作定义它回答什么问题
新增引用本周期出现、上周期没有的“域名—URL—prompt”组合可见度从哪里新进入?
留存引用当前和上一周期都出现的组合哪些来源仍在被选中?
流失引用上周期出现、当前周期消失的组合哪些位置没有守住?
恢复引用曾经流失、当前重新出现的组合哪些消失只是暂时的?
单周期留存率基线组合中,下个周期仍出现的比例上一期可见度留下多少?
三周期生存率基线组合中,连续三个周期都出现的比例稳定核心有多大?

域名和 URL 要分开算。一个域名整体留存正常,不代表具体产品页没有丢位置;某个 URL 消失,也可能是同域名下另一张更合适的页面接替了它。

prompt 同样属于比较单位。一个页面原来因“适合创业公司的薪酬软件”被引用,后来只在“薪酬软件是什么”里出现,这不能算原位置已经留存。话题覆盖和 prompt 留存,是两套问题。

---

发现引用流失后,应该怎么查

先确认它是真的流失,再决定要不要改页面。

第一步,重复运行。 单次缺席只够触发复查,还不足以证明持续下降。

第二步,固定测试条件。 尽量保持 prompt、引擎、模式、地区和账号状态一致。

第三步,记录替代来源。 只知道自己消失了,很难诊断;知道谁进入了答案,才有比较对象。

第四步,对比具体段落。 看替代页面是否更直接地回答了问题,证据是否更清楚,内容形态是否更贴合这个意图。

第五步,检查技术访问。 页面能否抓取,状态码是否正常,关键事实是否出现在可解析 HTML 中,canonical 和 robots 指令有没有变化。

第六步,核对事实时效。 过期价格、日期、库存、法规和失效来源应该更新。长期有效的事实,不需要为了制造“新鲜日期”反复改写。

第七步,做单变量修复。 一次改一个有意义的变量,能保留原 URL 时就保留,然后继续追踪同一组问题。

这套顺序能避开两个常见坑:看到一次波动就重写全文;一次同时改标题、结构、URL 和外链,最后即便引用回来,也不知道是哪一步起了作用。

---

内容团队真正要改的,是四件事

先改汇报方式。 把“获得引用”和“保住引用”拆成两张表。

再改选题方式。 围绕买家会反复提出的问题建内容,同时找出自己行业真正依赖的页面类型。DeltaV 的跨行业结果已经说明,套用一个“AI 最爱某种格式”的通用模板,很容易套错 [3]

然后改维护方式。 产品、规则、数据或引用来源发生变化时再更新。没有事实增量的日历式翻新,可能破坏原本好用的段落,却没有解决引用消失的原因。

最后改实验方式。 对比表、FAQ、价格说明、官方产品页、文章和榜单,都应该放进自己品类的固定问题组里测试。Somantra 的发现可以生成假设,不能直接生成一张适用于所有行业的改版清单。

还有一个经常被忽略的动作:主题没变时,尽量保持页面身份稳定。随意换 URL、改 canonical,或把关键事实移进只能靠 JavaScript 显示的组件,会在内容实验之外再引入一层技术变量。

---

Innflows 在这件事里解决什么

引用留存依赖连续、可比的观测。一张回答截图做不到这一点。

Innflows 可以围绕模拟用户问题进行周期监测,覆盖 ChatGPT、Gemini、Google AI Overviews、Google AI Mode、DeepSeek、通义千问和 Grok 等平台。结合监测、来源可信度和网站结构分析,品牌可以先建立分引擎基线,再识别可见度变化,并检查承载信息的来源和页面是否仍然可访问、表述是否一致。

具体到引用留存,做法是固定一组问题,保存每次出现的域名与 URL,再把变化归为新增、留存、流失和恢复。Innflows 提供持续观测和跨平台比较这一层;引用为什么消失,仍然需要人工诊断。

这条边界必须说清楚。GEO 能提高有用、可访问、有证据支持的内容进入检索和引用的概率。它不能保证某个 AI 引擎在固定时间里持续引用某张页面。

---

这些结论在什么情况下不适用

核心数字来自单一厂商研究。 Somantra 同时销售 AEO/GEO 服务,研究只覆盖澳大利亚保险。样本很大,但行业和商业背景限制了它的外推范围。

57.2% 是域名口径。 公开摘要没有证明 57.2% 的具体页面消失,也没有证明这些域名当月只获得了一次引用。

研究止于 2026 年 7 月。 七个观察月里没有回来,不能改写成永远不会回来。

内容形态是相关关系。 持续引用组更常出现对比、FAQ 和价格结构,但研究没有隔离内容形态的因果作用。权威性、问题匹配、分发能力和技术访问可能同时不同。

几份研究测的不是同一种稳定性。 Somantra 看七个观察月的域名存在情况;BrightEdge 看一周变化;DeltaV 看 90 天里的检索转引用。它们适合回答不同问题,不适合拼成一个行业基准值。

---

常见问题

什么是 AI 引用留存率?

AI 引用留存率,是此前出现过的引用组合,在后续可比测量中继续出现的比例。组合至少应包含引擎、prompt、被引域名或 URL 和测量周期。这是运营指标,不是 AI 平台公布的排名信号。

真的是 57.2% 的 AI 被引页面一个月后消失吗?

不是。Somantra 报告的是:在澳大利亚保险的七个观察月数据中,57.2% 的域名只在一个月出现 [1]。公开摘要没有给出单篇页面的同口径比例,也没有观察 2026 年 7 月之后的情况。

丢掉一次引用,是否说明页面失败了?

不能这么判断。AI 回答会随运行次数、prompt 和时间变化,单次缺席可能只是波动 [5]。应当在固定条件下重复测量,并观察多个周期。

品牌还要不要写长篇指南?

现有证据不支持全面停写。Somantra 发现“完整指南”更常出现在一次性引用组;DeltaV 则发现,八个行业里没有一种页面类型普遍占优 [2] [3]。长文只要能清楚回答具体问题、证据保持有效,仍然可以成为有用来源。

对比页更容易获得持续引用吗?

它值得优先测试。Somantra 观察到对比结构与持续引用相关;DeltaV 的样本里,对比页以每次检索产生 1.87 次引用排在所有页面类型首位 [1] [3]。两项研究都没有证明,把任意页面改成对比页就会延长引用寿命。

AI 引用应该多久测一次?

目前没有被验证为适用于所有行业的统一频率。变化快的品类可以按周观察,稳定品类可以按月建立队列;每个周期内还应重复运行。比频率本身更重要的,是保持 prompt、引擎、模式和地区口径一致。

---

核心结论

Somantra 的 243 万余条记录显示,AI 引用存在一条很长的一次性尾部:28,725 个域名中,57.2% 只在一个观察月出现,能贯穿七个观察月的只有 2.7% [1]。这足以推动品牌升级测量方式,但不足以宣布大多数内容已经永久死亡。

真正有用的区分,是稳定核心和波动边缘。固定问题组,把引用拆成新增、留存、流失和恢复;在自己的品类里测试页面形态;发现流失后,依次检查回答波动、检索变化、替代来源、技术访问和事实时效。

一次引用是一件事。持续可见,是一段时间里的重复模式。

---

参考来源

[1] - Somantra AI Publishes “Content Graveyard” Analysis: 57% of Domains Cited in ChatGPT and Google Are Never Cited Again — GlobeNewswire,2026 年 8 月 17 日

[2] - Long-Form Guides Vanish From AI Search After One Citation, Comparison Pages Survive — Tech Times,2026 年 8 月 17 日

[3] - We Analyzed 25,000+ AI Citations Across 5 Engines: Every Industry Has Its Own Citation Fingerprint — DeltaV Digital,2026 年 7 月 13 日

[4] - AI Search Citations: How Much Do They Really Change Week to Week? — BrightEdge,2026 年 2 月 6 日

[5] - Don't Measure Once: Measuring Visibility in AI Search (GEO) — arXiv:2604.07585,2026 年 4 月 8 日提交

[6] - Only 25% of Cited Sources Overlap Between ChatGPT's Different Reasoning Modes — Semrush 与 Growth Memo,2026 年 6 月 30 日

Related Articles

网页不会整页进入上下文:AI如何筛选关键、无关与重复片段

网页不会整页进入上下文:AI如何筛选关键、无关与重复片段

一个网页被搜索系统召回,不代表整页内容都会进入答案模型。2026 年 3 月,Perplexity 公布 Search API 的新一轮抽取与评测改进:系统会针对“查询—文档”组合标记文本 span,区分必须保留的 vital证据、应该排除的多类 irrelevant内容,以及duplicate重复信息。两个月后,Perplexity 又披露了已经部署到其应用与 API Platform 的 query-aware context compression 模型,进一步解释这些标签如何变成线上 snippet

Read
AI 为什么引用你?Bing Grounding Queries 首次揭开生成式搜索的检索线索

AI 为什么引用你?Bing Grounding Queries 首次揭开生成式搜索的检索线索

Microsoft 开始打开这段检索链。2026 年 2 月,Bing Webmaster Tools 推出 AI Performance 公测,展示网站在 Microsoft Copilot、Bing 的 AI 生成摘要及部分合作方体验中的引用次数、被引页面和 **Grounding Queries**。随后,Microsoft Clarity 在 5 月将 Citations 推向正式可用,并在 8 月增加 Query Topics,把大量检索短语聚合成主题

Read
AI 搜索没有统一排名:为什么不同人看到不同品牌?

AI 搜索没有统一排名:为什么不同人看到不同品牌?

你和同事把同一句产品问题发给同一个 AI 助手。你的回答先推荐品牌 A,他的回答却把品牌 C 放在前面;隔天再问,名单又变了。 这不一定是系统出错,也不能仅凭两张截图证明“AI 在针对个人改排名”。AI 搜索的品牌结果由多组条件共同决定:问题措辞与当前会话、产品允许使用的账户上下文、平台与模式,以及当次运行的检索和生成过程。只要其中一项不同,进入候选集的品牌、引用来源和最终顺序都可能变化。 更准确的说法是:AI 搜索里的品牌可见度是一组带条件的概率分布,而不是所有人共享的一张固定排名表。

Read