57% 的 AI 被引域名只出现了一个月:一次被引用,不等于持续可见

57% 的 AI 被引域名只出现了一个月:一次被引用,不等于持续可见
先给结论: Somantra 对澳大利亚保险品类做了一次纵向追踪。样本包含 2,437,107 条引用记录、28,725 个域名,覆盖 2025 年 11 月至 2026 年 7 月之间的七个观察月。结果是,57.2% 的域名只在其中一个月出现过,能在七个观察月里持续出现的只有 2.7% [1]。
这不代表 57.2% 的页面从此永远消失。它说明的是另一件事:“拿到过一次 AI 引用”这个指标,远远不足以证明品牌已经建立了持续可见度。
一次引用是一件事。能不能留下来,是另一件事。
---
先别急着渲染“内容墓场”,这项研究到底测了什么
这项研究的价值,在于它没有只截一张某天的可见度快照,而是沿时间观察引用有没有再次出现。研究范围如下 [1] [2]:
| 项目 | 研究口径 |
|---|---|
| 引用记录 | 2,437,107 条 |
| 独立域名 | 28,725 个 |
| 观察时间 | 2025 年 11 月至 2026 年 7 月之间的七个观察月 |
| 市场 | 澳大利亚保险 |
| AI 产品 | ChatGPT 搜索、Google AI Overviews |
| 只在一个月出现的域名 | 57.2% |
| 七个观察月均出现的域名 | 2.7% |
最容易被标题带偏的地方有两个。
第一,57.2% 统计的是域名,不是单篇页面。 一个域名可能在那个月只拿到一次引用,也可能拿到很多次。公开摘要没有披露足够信息,让我们计算具体 URL 的回归率,也没有给出 ChatGPT 与 Google 各自的留存差异。
第二,“再也没有被引用”必须带上时间边界。 准确说法是:这些域名在七个观察月中只出现于一个月,此后直到 2026 年 7 月都没有再次出现。研究没有观察 2026 年 7 月之后发生了什么。
所以,“57% 的内容永久死亡”不是这项研究支持的结论。
---
为什么“被引用过”是一个很弱的成功指标
一次引用至少经过三步:AI 发起搜索、检索到页面、把页面选进某一次回答的来源列表。下一次运行,这三步都可能发生变化。
一篇 2026 年 4 月提交的信息检索预印本,专门讨论了这个测量问题。作者指出,AI 回答会随运行次数、prompt 表达和时间变化,因此单次观测并不可靠;更合适的做法,是重复测量,并把可见度看成一个分布,而不是一个固定点位 [5]。
这会直接改变看板上的“好消息”该怎么读:
- 出现过: 某个域名或 URL 是否至少被引用一次?
- 能复现: 同一组问题重复测量时,它是否再次出现?
- 能留存: 跨多个周期,它是否持续在场?
- 能恢复: 消失之后,它有没有重新回来?
- 有贡献: 它只是挂在来源列表里,还是实际支撑了回答?
Somantra 的研究主要触及前三层。它没有测量引用是否带来品牌提及,也没有证明引用改变了最终推荐。
这也是为什么“本月新增引用数”不能单独作为 GEO 成绩。新增很多,可能只是长尾噪声;总量没变,也可能是稳定核心正在流失,同时被一批一次性来源填平。
---
57% 只出现一个月,为什么另一份研究却说 96.8% 很稳定
因为 AI 引用可以同时存在两个区域:核心很稳,边缘很吵。
BrightEdge 对五个 AI 引擎、九个行业做过一次周度对比。在它测量的那一周,96.8% 的被引域名没有变化。但在发生变化的约 3% 域名里,87% 是下降;而且大多不是缓慢下滑,而是从某个 prompt 的来源列表里直接消失 [4]。
两项研究的样本、周期、行业和指标定义都不同,不能把数字直接相减。但放在一起,能看出一个很有用的结构:
| 引用区域 | 数据呈现出来的特征 | 对看板的要求 |
|---|---|---|
| 稳定核心 | 一小批来源在短周期里可以非常稳定 | 单独计算重复出现的引用占比 |
| 波动边缘 | 一次性和临界来源可能短暂进入,随后消失 | 不把每条新增引用都算成持续增长 |
BrightEdge 还发现,高引用量域名通常拥有更大的波动边缘,不过在它测量的那一周,这部分一般只占头部域名引用份额的约 5% [4]。
问题就出在平均数上。一个总可见度分数,会把稳定核心和波动边缘揉在一起。曲线看着平,核心可能正在缩水;曲线上升,也可能只是涌入了一批下个周期就消失的新来源。
---
对比页和 FAQ 真的更容易留下来吗
目前只能说存在相关性,因果还没有被证明。
在 Somantra 的澳大利亚保险数据里,带有对比、FAQ、折扣或价格结构的页面,在持续引用组中的出现率,约为一次性引用组的两倍。标为“完整指南”的内容,在只出现一个月的域名中则多出 3.5 倍 [1] [2]。
另一项 DeltaV Digital 研究提供了部分呼应,也给这条结论踩了刹车。它在 90 天里追踪了五个引擎、八个行业的 21,075 条回答,分析其中 25,337 次引用。对比页的“每次被检索后产生多少引用”最高,达到 1.87,比全部页面的平均值 1.29 高 45%;但对比页只占总引用的 4.1% [3]。
更重要的是,不同行业吃的内容完全不同:
| 行业样本 | 引用占比最高的页面类型 | DeltaV 报告占比 |
|---|---|---|
| B2B 技术服务 | 榜单页 | 61% |
| 本地医美服务 | 首页 | 55% |
| 医疗健康信息 | 文章 | 54% |
| 高等教育 | 项目页 | 53% |
所以,真正可执行的结论不是“以后别写长文,全改对比页”。
更稳妥的读法是:结构清楚的对比内容,在已有数据里表现出较高的检索转引用效率;但每个行业都有自己的引用指纹。 一篇长文也可以包含边界清楚的问答、对比表和自包含段落。公开研究没有把篇幅单独拿出来做受控实验。
内容团队该问的,是页面里有没有能够反复回答真实问题的段落,而不是先问文章够不够长。
---
一条引用为什么会消失
现有研究能指出几个故障点,但还拼不出一套完整的因果模型。
同一个问题,本来就可能生成不同答案
生成式回答具有概率性。同一个 prompt 重复运行,品牌、排序和来源都可能变化。学术测量框架因此强调重复采样 [5]。一次没出现,可能只是本轮波动;连续多个周期都消失,才更像需要处理的问题。
同一个 ChatGPT,模式不同也会换来源
Semrush 与 Growth Memo 用 100 个 prompt、20 条买家旅程测试了不同推理模式。报告称,minimal 与 high reasoning 两种模式之间,被引域名的重合率只有 25.6%,高推理模式还会发起更多搜索 [6]。这是厂商研究,但它提醒了一件事:只写“ChatGPT 可见度”,口径可能已经太粗。
页面可能只站在波动边缘
BrightEdge 的数据表明,变化更集中在稳定核心之外。一个页面可以在某次回答里足够相关,却没有相关到不可替代。下一轮检索到更具体的来源,它就可能被换掉 [4]。
页面周围的证据环境变了
竞争对手发布新内容、官方来源更新、页面事实过期、抓取权限变化、canonical 或 robots 配置调整,都可能影响结果。这些是排查方向,不是已经被本文来源逐项证明的原因。要解释某条引用为什么消失,必须回到具体的 prompt、引擎、替代来源、页面和时间点。
---
一张真正有用的引用看板,应该多出哪些指标
要测留存,比较单位必须固定。prompt、引擎、模式、地区和采样频率如果同时变化,月度差异反映的可能是测试变了,而不是品牌可见度变了。
下面这套指标是一种实用的运营框架,不是 AI 平台公布的排名因子:
| 指标 | 工作定义 | 它回答什么问题 |
|---|---|---|
| 新增引用 | 本周期出现、上周期没有的“域名—URL—prompt”组合 | 可见度从哪里新进入? |
| 留存引用 | 当前和上一周期都出现的组合 | 哪些来源仍在被选中? |
| 流失引用 | 上周期出现、当前周期消失的组合 | 哪些位置没有守住? |
| 恢复引用 | 曾经流失、当前重新出现的组合 | 哪些消失只是暂时的? |
| 单周期留存率 | 基线组合中,下个周期仍出现的比例 | 上一期可见度留下多少? |
| 三周期生存率 | 基线组合中,连续三个周期都出现的比例 | 稳定核心有多大? |
域名和 URL 要分开算。一个域名整体留存正常,不代表具体产品页没有丢位置;某个 URL 消失,也可能是同域名下另一张更合适的页面接替了它。
prompt 同样属于比较单位。一个页面原来因“适合创业公司的薪酬软件”被引用,后来只在“薪酬软件是什么”里出现,这不能算原位置已经留存。话题覆盖和 prompt 留存,是两套问题。
---
发现引用流失后,应该怎么查
先确认它是真的流失,再决定要不要改页面。
第一步,重复运行。 单次缺席只够触发复查,还不足以证明持续下降。
第二步,固定测试条件。 尽量保持 prompt、引擎、模式、地区和账号状态一致。
第三步,记录替代来源。 只知道自己消失了,很难诊断;知道谁进入了答案,才有比较对象。
第四步,对比具体段落。 看替代页面是否更直接地回答了问题,证据是否更清楚,内容形态是否更贴合这个意图。
第五步,检查技术访问。 页面能否抓取,状态码是否正常,关键事实是否出现在可解析 HTML 中,canonical 和 robots 指令有没有变化。
第六步,核对事实时效。 过期价格、日期、库存、法规和失效来源应该更新。长期有效的事实,不需要为了制造“新鲜日期”反复改写。
第七步,做单变量修复。 一次改一个有意义的变量,能保留原 URL 时就保留,然后继续追踪同一组问题。
这套顺序能避开两个常见坑:看到一次波动就重写全文;一次同时改标题、结构、URL 和外链,最后即便引用回来,也不知道是哪一步起了作用。
---
内容团队真正要改的,是四件事
先改汇报方式。 把“获得引用”和“保住引用”拆成两张表。
再改选题方式。 围绕买家会反复提出的问题建内容,同时找出自己行业真正依赖的页面类型。DeltaV 的跨行业结果已经说明,套用一个“AI 最爱某种格式”的通用模板,很容易套错 [3]。
然后改维护方式。 产品、规则、数据或引用来源发生变化时再更新。没有事实增量的日历式翻新,可能破坏原本好用的段落,却没有解决引用消失的原因。
最后改实验方式。 对比表、FAQ、价格说明、官方产品页、文章和榜单,都应该放进自己品类的固定问题组里测试。Somantra 的发现可以生成假设,不能直接生成一张适用于所有行业的改版清单。
还有一个经常被忽略的动作:主题没变时,尽量保持页面身份稳定。随意换 URL、改 canonical,或把关键事实移进只能靠 JavaScript 显示的组件,会在内容实验之外再引入一层技术变量。
---
Innflows 在这件事里解决什么
引用留存依赖连续、可比的观测。一张回答截图做不到这一点。
Innflows 可以围绕模拟用户问题进行周期监测,覆盖 ChatGPT、Gemini、Google AI Overviews、Google AI Mode、DeepSeek、通义千问和 Grok 等平台。结合监测、来源可信度和网站结构分析,品牌可以先建立分引擎基线,再识别可见度变化,并检查承载信息的来源和页面是否仍然可访问、表述是否一致。
具体到引用留存,做法是固定一组问题,保存每次出现的域名与 URL,再把变化归为新增、留存、流失和恢复。Innflows 提供持续观测和跨平台比较这一层;引用为什么消失,仍然需要人工诊断。
这条边界必须说清楚。GEO 能提高有用、可访问、有证据支持的内容进入检索和引用的概率。它不能保证某个 AI 引擎在固定时间里持续引用某张页面。
---
这些结论在什么情况下不适用
核心数字来自单一厂商研究。 Somantra 同时销售 AEO/GEO 服务,研究只覆盖澳大利亚保险。样本很大,但行业和商业背景限制了它的外推范围。
57.2% 是域名口径。 公开摘要没有证明 57.2% 的具体页面消失,也没有证明这些域名当月只获得了一次引用。
研究止于 2026 年 7 月。 七个观察月里没有回来,不能改写成永远不会回来。
内容形态是相关关系。 持续引用组更常出现对比、FAQ 和价格结构,但研究没有隔离内容形态的因果作用。权威性、问题匹配、分发能力和技术访问可能同时不同。
几份研究测的不是同一种稳定性。 Somantra 看七个观察月的域名存在情况;BrightEdge 看一周变化;DeltaV 看 90 天里的检索转引用。它们适合回答不同问题,不适合拼成一个行业基准值。
---
常见问题
什么是 AI 引用留存率?
AI 引用留存率,是此前出现过的引用组合,在后续可比测量中继续出现的比例。组合至少应包含引擎、prompt、被引域名或 URL 和测量周期。这是运营指标,不是 AI 平台公布的排名信号。
真的是 57.2% 的 AI 被引页面一个月后消失吗?
不是。Somantra 报告的是:在澳大利亚保险的七个观察月数据中,57.2% 的域名只在一个月出现 [1]。公开摘要没有给出单篇页面的同口径比例,也没有观察 2026 年 7 月之后的情况。
丢掉一次引用,是否说明页面失败了?
不能这么判断。AI 回答会随运行次数、prompt 和时间变化,单次缺席可能只是波动 [5]。应当在固定条件下重复测量,并观察多个周期。
品牌还要不要写长篇指南?
现有证据不支持全面停写。Somantra 发现“完整指南”更常出现在一次性引用组;DeltaV 则发现,八个行业里没有一种页面类型普遍占优 [2] [3]。长文只要能清楚回答具体问题、证据保持有效,仍然可以成为有用来源。
对比页更容易获得持续引用吗?
它值得优先测试。Somantra 观察到对比结构与持续引用相关;DeltaV 的样本里,对比页以每次检索产生 1.87 次引用排在所有页面类型首位 [1] [3]。两项研究都没有证明,把任意页面改成对比页就会延长引用寿命。
AI 引用应该多久测一次?
目前没有被验证为适用于所有行业的统一频率。变化快的品类可以按周观察,稳定品类可以按月建立队列;每个周期内还应重复运行。比频率本身更重要的,是保持 prompt、引擎、模式和地区口径一致。
---
核心结论
Somantra 的 243 万余条记录显示,AI 引用存在一条很长的一次性尾部:28,725 个域名中,57.2% 只在一个观察月出现,能贯穿七个观察月的只有 2.7% [1]。这足以推动品牌升级测量方式,但不足以宣布大多数内容已经永久死亡。
真正有用的区分,是稳定核心和波动边缘。固定问题组,把引用拆成新增、留存、流失和恢复;在自己的品类里测试页面形态;发现流失后,依次检查回答波动、检索变化、替代来源、技术访问和事实时效。
一次引用是一件事。持续可见,是一段时间里的重复模式。
---
参考来源
[4] - AI Search Citations: How Much Do They Really Change Week to Week? — BrightEdge,2026 年 2 月 6 日
[5] - Don't Measure Once: Measuring Visibility in AI Search (GEO) — arXiv:2604.07585,2026 年 4 月 8 日提交


