技术

GPTBot、CCBot 等 AI 爬虫究竟如何抓取你的网站:技术分析

Leo Wang April 23, 2026
GPTBot、CCBot 等 AI 爬虫究竟如何抓取你的网站:技术分析

AI爬虫技术深度解析:GPTBot与CCBot究竟如何抓取你的网站?

GPTBot、CCBot等AI爬虫正以前所未有的规模扫描全球网站。仅GPTBot一个月内就在主要网络中发起了5.69亿次请求。如今,全球约30%的网络流量来自机器人,而GPTBot的份额在2024年5月至2025年5月间从5%飙升至30%。这些数据爬虫消耗的带宽同样惊人——中型网站每月面临138 GB的流量负担和1,380美元的额外成本。本文将深入拆解OpenAI爬虫及其他AI网络爬虫定位和抓取内容的技术原理,分析它们的请求模式,并探讨包括OpenAI robots.txt配置在内的防御机制。

AI爬虫如何定位并访问你的网站

在任何爬虫抓取你的内容之前,它必须先通过DNS解析将域名转换为机器可读的IP地址。数据爬虫在与你的站点建立连接时,会查询DNS解析器,将域名转换为对应的IP地址。这一转换过程需要多种服务器类型的协同配合:DNS解析器首先联系根域名服务器,根据你的域名后缀将请求定向到相应的顶级域服务器,再由顶级域服务器将解析器引导至你的权威域名服务器——这里存储着将域名映射到IP地址的实际DNS记录。

DNS解析与初始连接

DNS解析是AI网络爬虫运行中的一个关键瓶颈。由于DNS接口的同步特性,DNS请求通常需要10ms到200ms才能完成 1。一旦某个爬虫线程发起DNS请求,其他线程会被阻塞,直到该请求完成。OpenAI爬虫和其他AI机器人通过维护DNS缓存系统来应对这一限制,将域名到IP的映射关系存储在缓存中。自动化任务会定期更新这些缓存,避免对高频访问的域名进行重复DNS查询。整个解析过程通常在100毫秒以内完成 2,在日常操作中几乎无感,但在爬虫规模下影响显著。

因此,GPT爬虫系统和类似机器人会以极为激进的方式缓存DNS信息。浏览器缓存、操作系统缓存以及解析器自身的缓存构成了多层缓存体系,大幅缩短了常访站点的解析时间。热门DNS解析器由于维护着更大的缓存池,能够提供更快的响应速度。每条DNS记录都有一个TTL值来决定缓存时长,这直接影响爬虫在DNS变更后重新连接你站点的速度。

入口发现方法

爬虫使用种子URL作为访问入口。举个例子,爬虫可能以某所大学的域名作为种子URL来抓取整个校园网站 1。系统从种子URL出发,沿着发现的链接向外扩展。这些种子URL来源多样:XML站点地图、此前已索引的页面,或手动指定的列表 1。OpenAI机器人还可以通过其公共DNS服务观察查询记录、通过已安装的分析工具获取数据,或通过浏览器扩展程序上报访问过的URL来发现你的站点。

爬取前沿(crawl frontier)是一个队列结构,用于存储爬虫已发现但尚未下载的URL 1。该数据结构遵循先进先出原则,但现代爬虫会在此基础上叠加优先级逻辑。调度器负责管理这个队列,根据页面重要性、内容新鲜度预估和域名限制来决定下一步访问哪些URL 1。首页和高权威页面的优先级高于深层嵌套页面,更新频繁的站点比静态文档获得更高的抓取频率。

在2026年,robots.txt承担着控制OpenAI爬虫和其他AI机器人的双重职责 3。该文件既管理传统搜索引擎的访问权限,也管理AI训练机器人的权限。OpenAI的robots.txt配置现在直接决定了你的内容是否有资格进入AI模型训练数据集,还是仅用于实时答案生成。

抓取预算分配逻辑

抓取预算(Crawl Budget)定义了爬虫能够且愿意访问的站点URL集合。Google的系统通过两个要素来计算:抓取容量上限和抓取需求 4。容量上限代表爬虫在不压垮服务器的前提下,可使用的最大并行连接数。Google的爬虫会精确计算这一上限,在确保重要内容完整覆盖的同时防止服务器过载。

抓取需求因爬虫类型和用途而异。AdsBot在站点运行动态广告定向时会保持更高的需求,产品爬虫则根据商品Feed内容调整活跃度 4。对于AI爬虫而言,需求取决于内容质量和训练价值,而非单纯的更新频率。AI系统更青睐少而精的高质量页面 5,会更快地降低噪声URL的优先级,并依赖抓取的一致性。如果你的内容发布不规律或表现出不稳定性,OpenAI机器人可能会直接放弃将其作为数据来源。

存在大量重复URL或无效页面的站点会浪费爬虫资源 4。当站点存在大量重复内容时,爬虫会把时间花在低价值页面上。即使抓取容量上限未达到,低需求也会降低抓取频率。加载速度快、链接结构清晰的页面比加载缓慢、组织混乱的站点更容易被高效抓取 1。服务器响应时间直接影响抓取模式——响应缓慢或不稳定的服务器会触发自动降频机制。

技术抓取流程:逐步拆解

爬虫与你的服务器建立连接后,会构造一个HTTP GET请求来获取页面内容。该请求包含指定可接受内容类型的头部信息,通常为"text/html"。OpenAI机器人和其他AI网络爬虫通过请求头中的User-Agent字符串来标识自身身份,GPTBot正是通过这种方式与普通浏览器流量区分开来。爬虫将请求发送到你服务器的IP地址,由此启动驱动所有网页抓取操作的基础数据交换。

第一步:HTTP请求发起

HTTP请求本质上是一条结构化消息,向你的服务器请求特定资源。编程库会自动处理请求的构造过程。Python的requests库通过管理连接处理、头部构建和错误捕获来简化这一流程。请求中指定了目标URL、HTTP方法(抓取场景下几乎都是GET),以及控制缓存行为和压缩优先级的附加头部。现代数据爬虫系统能够同时发送数千个请求,并将负载分配到多个线程以最大化吞吐量。

第二步:服务器响应分析

你的服务器会返回HTTP状态码、响应头和请求的内容。200状态码表示成功获取,429则表示触发了速率限制,迫使爬虫降低请求频率。响应头中的内容类型决定了爬虫如何处理返回的数据:HTML响应会被直接解析,API端点返回的JSON响应则提供无需HTML开销的结构化数据。单页应用(SPA)让这一过程变得更加复杂——它们初始只返回极少的HTML,随后通过JavaScript驱动的API调用加载内容。爬虫会监控网络流量并捕获这些二次请求,直接从API响应中提取数据,而非等待DOM渲染完成。

第三步:内容解析与提取

原始HTML以一长串文本字符串的形式到达,需要被转换为可导航的结构。解析库将这个字符串转换为文档对象模型(DOM),创建一棵可搜索的元素树。Python中的BeautifulSoup等工具通过CSS选择器或XPath查询遍历这棵DOM树,定位特定数据。你检查页面HTML,识别包裹目标内容的标签和类名,爬虫复制这一过程,选择类似 span.titleline > a 的元素来提取文章标题。提取过程中会清理空白字符、特殊字符和格式残留,确保数据质量可用。

使用异步渲染的现代网站需要执行JavaScript才能填充内容。传统HTML解析在这里会失效,因为初始源码中缺少所需数据。爬虫通过在无头浏览器中渲染页面来解决这个问题,等待JavaScript执行并填充DOM。网络请求监控提供了另一种思路——爬虫拦截你站点用于获取数据的API调用,直接捕获结构化的JSON数据,绕过脆弱的DOM选择器。

第四步:链接发现与队列管理

爬虫在提取内容的同时,会识别嵌入在锚标签、站点地图和canonical标签中的超链接。每个发现的URL都成为未来抓取的候选对象,被添加到请求队列中——一个存储待下载URL的动态数据结构。队列基于优先级逻辑运作,而非简单的先进先出。来自高权威页面的URL以更高优先级进入队列,确保重要内容优先被抓取。

大规模队列管理需要去重机制,防止重复抓取相同的URL。布隆过滤器提供了空间高效的概率性检查方案。爬虫发现一个URL后,查询布隆过滤器判断该URL是否已被处理过。虽然偶尔会出现误判导致新URL被跳过,但这种权衡使得处理海量URL集合成为可能,无需进行穷举式数据库查询。分布式爬虫通过一致性哈希在多个节点间共享队列并分配URL,防止不同爬虫同时访问相同页面。

第五步:数据存储与索引

提取的内容被组织成针对检索和分析优化的格式。搜索引擎构建倒排索引,将词语映射到包含它们的页面,同时维护文档存储以保留原始内容和元数据。Common Crawl生成WARC文件——一种标准化的归档格式,完整捕获HTTP事务的请求和响应数据。结构化提取根据下游处理需求输出为JSON、CSV或XML格式。存储层实施清洗算法,在最终持久化之前去除重复和错误数据,确保AI训练数据集或搜索索引的数据质量。

OpenAI爬虫:GPTBot与ChatGPT-User的技术行为

OpenAI运营着多个独立的用户代理,各自在其生态系统中承担特定功能。GPTBot抓取公开可用的内容用于训练生成式AI基础模型,ChatGPT-User则执行由用户请求触发的操作,而非自主扫描。第三个代理OAI-SearchBot专注于在ChatGPT的搜索功能中呈现网站。每个代理独立运作,允许你在许可搜索索引的同时屏蔽训练数据采集。

GPTBot的请求特征

GPTBot通过特定的User-Agent字符串标识自身:Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.3; +https://openai.com/gptbot 6。这种透明的身份标识使得服务器日志分析和定向屏蔽成为可能。OpenAI在 https://openai.com/gptbot.json 公布IP地址范围 6,提供了超越User-Agent检查的可验证来源验证。GPTBot在AI爬虫中的市场份额从2024年7月的4.7%跃升至2025年7月的11.7% 7,反映出训练数据需求的持续增长。

该爬虫在采集过程中会进行内容过滤,自动排除需要付费墙访问的页面、收集个人身份信息的来源,以及违反OpenAI内容政策的文本 6。这一预处理发生在数据进入训练管线之前,但具体的过滤算法仍属专有技术。GPTBot仍然是被屏蔽最多的AI爬虫,截至2025年6月已有312个域名禁止其访问 7。但也有61个域名明确允许GPTBot访问,认可其在ChatGPT输出中带来的潜在可见性收益 7

ChatGPT-User的API驱动抓取

ChatGPT-User的运作方式与传统网络爬虫截然不同。当用户向ChatGPT提问或与自定义GPT交互时,系统可能会使用ChatGPT-User代理访问网页 6。其完整的User-Agent字符串为:Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot 6。已公布的IP地址列表见 https://openai.com/chatgpt-user.json 6

OpenAI于2025年12月9日修订了ChatGPT-User文档,删除了表明遵守robots.txt的相关表述 8。更新后的文档明确声明:"由于这些操作由用户发起,robots.txt规则可能不适用" 6。这将ChatGPT-User定位为人类浏览的代理,而非自主爬虫。其请求量在2024年5月至2025年5月间暴增2,825%,达到爬虫总流量的1.3% 7。这一政策变化意味着传统的爬虫控制机制已无法限制用户发起的ChatGPT操作。

OpenAI的robots.txt合规机制

在2025年12月的文档更新之后,只有OAI-SearchBot和GPTBot仍然遵守robots.txt指令 8。站点可以允许一个机器人的同时屏蔽另一个。例如,允许OAI-SearchBot以获得搜索可见性,同时禁止GPTBot以阻止训练数据使用。屏蔽OAI-SearchBot不再意味着你的站点会从ChatGPT搜索结果中消失——还有其他途径可以被收录 8

当两个机器人都获得访问许可时,OpenAI可能会复用单次抓取的结果用于双重目的,以避免重复请求 6。系统在robots.txt更新后大约需要24小时来完成调整 6,这一延迟反映了缓存传播和分布式基础设施中抓取调度的协调过程。

内容选择算法

OpenAI爬虫奉行质量优先于数量的原则。系统偏好少量高质量页面,对噪声URL的降权速度快于传统搜索爬虫。发布不规律或表现不稳定的内容会被排除在数据来源之外。GPTBot在将内容纳入训练数据集之前,会检查其结构清晰度和可用性一致性。即使robots.txt允许访问,存在大量重复内容的站点也会浪费爬虫资源并降低未来的抓取频率。

CCBot与Common Crawl的数据采集架构

Common Crawl是一家成立于2007年的501(c)(3)非营利组织,致力于推动网络信息的民主化访问。该组织生产并维护着一个开放的网络爬取数据仓库,任何人都可以访问和分析 2。语料库包含自2008年以来收集的PB级数据 9。这一开放数据集让跨组织、学术界和非营利机构的协作研究成为可能,共同应对气候变化和公共卫生等复杂挑战 2。截至2024年,已有超过10,000项学术研究引用了Common Crawl 10,充分体现了其对研究社区的深远影响。

开放数据集的目标与方法论

CCBot是该组织的网络爬虫,通过UserAgent字符串标识自身:CCBot/2.0 (https://commoncrawl.org/faq/) 2 1。爬虫运行在专用IP地址段上,支持反向DNS验证。网站管理员可以验证日志中的请求是否来自真正的CCBot 2 1。CCBot基于Apache Nutch构建,遵守robots.txt指令,同时对单个服务器的请求进行速率限制 4。爬虫同时支持HTTP/1.1和HTTP/2协议,后者仅通过TLS(https://)使用 1

CCBot使用调和中心性(Harmonic Centrality)来确定URL的抓取优先级 4。这一图论度量指标反映了节点与网络结构核心的接近程度,基于Web Graph数据计算,与PageRank配合使用 4。爬虫内置了多种算法来防止对特定域名的Web服务器造成过大负载 1。它采用自适应退避算法,当你的Web服务器返回HTTP 429或5xx状态码时自动降低请求频率 1。默认情况下,爬虫在向同一站点发送下一个请求前会等待数秒 1

抓取频率与更新周期

每个抓取周期处理约30亿个页面 4。Common Crawl每月发布30至50亿个页面的抓取数据 5。历史归档总量超过2,500亿个页面 5。以2025年8月的抓取为例,新增了24.2亿个页面,数据总量超过419 TiB 11。数据集规模达到PB级 5,存储在Amazon Web Services的公共数据集中,位于s3://commoncrawl/存储桶,US-East-1(北弗吉尼亚)AWS区域 12。Amazon托管的语料库可免费访问 9

Common Crawl将数据组织为周期性抓取,如CC-MAIN-2025-33或CC-MAIN-2025-19 11。每次抓取对应一个时间段,CC-MAIN-2025-33代表2025年的第33次抓取 11

WARC文件生成流程

WARC(Web ARChive)格式提供抓取的原始数据,与抓取过程直接对应 4 13。WARC文件存储来自被访网站的HTTP响应(WARC-Type: response)、请求信息(WARC-Type: request),以及抓取过程本身的元数据(WARC-Type: metadata) 4 13。该格式采用追加写入方式,一旦写入即不可变更 4

WAT(Web Archive Transformation)文件包含WARC格式记录的重要元数据 4,针对每种记录类型计算,包括HTTP头部和链接图谱 4。WET(WARC Encapsulated Text)文件包含从抓取的HTML中提取的纯文本内容,适用于NLP任务 4。这些文件仅包含提取的纯文本,专为只需要文本信息的任务设计 13

如何监测你站点上的爬虫活动

服务器访问日志记录了对你网站发出的每一个请求,完整捕获人类用户和机器人交互的数据 14。每条日志条目包含六个制表符分隔的字段:时间戳、消息级别、爬虫线程名、组件名、模块名和消息内容 15。这些原始数据为你提供了OpenAI机器人、CCBot和其他AI网络爬虫与你站点交互的无过滤视图 14

服务器日志分析技术

你的主机面板通常会在正常流量旁显示简单的机器人活动信息 16。通过cPanel查看原始访问日志,可以看到机器人访问与人类活动并列显示 16。标准日志文件为每次访问捕获IP地址、时间戳、请求URL、HTTP方法、状态码和User-Agent 17。你可以手动下载数据并在电子表格中解析日志,也可以通过专业工具实现自动化分析 18

四个字段最为关键:IP地址用于分组命中并映射到网络,User-Agent用于比较字符串并标记异常组合,时间戳用于绘制频率图表并检测突发流量,状态码用于监控429和403响应 3。这些字段之间的关联分析能够揭示随时间推移的隐蔽行为模式 3

通过User-Agent识别爬虫

Googlebot的标识为 Mozilla/5.0 (compatible; Googlebot/2.1; +https://www.google.com/bot.html),GPTBot则显示为 Mozilla/5.0 AppleWebKit/537.36 (compatible; GPTBot/1.0; +https://openai.com/gptbot) 17。但仅凭User-Agent字符串并不可靠,因为任何恶意数据爬虫都可以伪造这一标识 19。任何人都可以在自己的电脑上通过伪造User-Agent字符串来冒充ClaudeBot 20

IP验证提供了可靠的确认手段。将所有IP与爬虫运营商公布的地址范围进行比对 20。反向DNS验证可以确认日志中的请求是否来自合法来源 21

请求量追踪

设置紧凑的时间窗口,标记超出速率阈值的IP 3。按路径绘制流量峰值图,按User-Agent分组 3。真实用户在站点中随意浏览,而机器人则系统性地扫描 3。以下信号指向自动化抓取行为:夜间或非高峰时段的突发流量、大量200状态码后紧跟429/503响应波、对站点地图和API的重复访问,以及请求之间的均匀间隔 3

折线图可以直观展示机器人访问的趋势变化 14。Googlebot访问量的急剧下降可能预示着需要排查的问题,而访问量激增则表明代码变更触发了重新抓取 14

带宽消耗计算

带宽监控能够发现按IP、ASN或路径维度的异常跳变 3。将流量突发与日志时间戳对照,基于发送字节数而非仅仅是命中次数进行流量分析 3。按传输字节数排序Top IP,然后审查其请求路径 3。曾有站长反馈,GPTBot在单月内消耗了30TB的带宽 22

404错误率分析

来自少量来源的大量404响应表明存在字典式攻击,目的是映射站点结构 23。短时间内出现数百甚至数千个"Not Found"响应,说明机器人在探测隐藏目录,而非像人类访客那样正常浏览 23。追踪404或500错误随时间变化的错误分布图可以简化监控工作 14

技术防御与控制机制

控制AI网络爬虫的访问需要在协议层、应用层和基础设施层实施多层防御。每种防御机制针对不同的攻击向量。

robots.txt配置示例

robots.txt文件向合规机器人传达抓取优先级 24。将此文件放置在根目录(https://example.com/robots.txt)。你可以在允许搜索爬虫的同时屏蔽GPTBot:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

选择性目录控制允许特定路径的访问:

User-agent: GPTBot
Allow: /public/
Allow: /blog/
Disallow: /

需要注意的是,robots.txt依赖于自愿合规 24。合规的机器人会遵守这些指令,但其他机器人可能会直接忽略 25

速率限制实施

速率限制对单个IP地址的请求频率设置上限 26。标准用户通常获得每分钟60次请求的配额,而数据中心IP则被限制在每分钟10次 27。超出限制时服务器返回429状态码 28。建议实施指数退避策略:等待1秒,然后2秒,再4秒后重试 28

防火墙规则屏蔽爬虫

Apache服务器使用.htaccess规则屏蔽特定User-Agent 29

RewriteCond %{HTTP_USER_AGENT} GPTBot [NC]
RewriteRule .* - [F,L]

基于IP的屏蔽使用 https://openai.com/gptbot.json 提供的经过验证的地址范围 29

边缘平台执行方法

Cloudflare会在现有文件之前预置托管的robots.txt指令 30。Fastly Bot Management在网络边缘对流量进行分类,仅将合法请求转发至源站,从而降低源站成本 31

结语

GPTBot和CCBot等AI爬虫通过系统化的技术流程运作:DNS解析、HTTP请求构造、内容解析、链接发现和结构化数据存储。这些机器人通过User-Agent字符串和IP范围标识自身。然而,对robots.txt的合规程度差异显著——ChatGPT-User已不再遵守传统的抓取指令,而GPTBot和CCBot仍保持协议合规。

持续监控你的服务器日志,追踪带宽消耗模式。实施将robots.txt指令与速率限制和防火墙规则相结合的多层防御策略。深入理解这些技术机制,才能在保护内容资产与维持AI搜索可见性之间做出明智的决策。

常见问题

Q1. 应该屏蔽GPTBot和CCBot等AI爬虫,还是允许它们访问我的站点?
这取决于你的内容策略和商业模式。如果你运营的是以流量变现为核心的内容站点(通过广告或联盟营销),屏蔽AI爬虫可能有助于保护内容价值,因为AI摘要可能减少点击量。但如果你的目标是品牌建设或思想领导力,允许特定爬虫访问可以提升在AI搜索结果中的可见性。建议区分对待:提供来源引用的AI搜索机器人(如PerplexityBot)和不带来引荐流量的训练爬虫(如CCBot)。

Q2. 如何识别哪些AI爬虫正在访问我的网站?
通过检查服务器访问日志中的特定User-Agent字符串来识别AI爬虫。GPTBot显示为"Mozilla/5.0 AppleWebKit/537.36 (compatible; GPTBot/1.0; +https://openai.com/gptbot)",CCBot显示为"CCBot/2.0 (https://commoncrawl.org/faq/)"。但仅凭User-Agent字符串并不完全可靠,因为它们可以被伪造。为确保准确性,请将IP地址与爬虫运营商官方公布的地址范围进行交叉验证。

Q3. 屏蔽AI训练机器人会影响我在AI搜索结果中的可见性吗?
屏蔽AI模型训练机器人(如GPTBot或Google-Extended)通常不会影响你在AI搜索结果或实时AI助手回答中的出现频率。这是两套独立的系统:训练机器人构建基础模型,而搜索机器人和助手机器人处理实时查询和答案生成的索引。你可以屏蔽训练爬虫,同时允许搜索类机器人以维持可见性。

Q4. Perplexity和ChatGPT等AI搜索引擎实际能为网站带来多少流量?
目前,来自AI搜索引擎的引荐流量在大多数站点的总流量中占比很小,通常不到1-2%。传统搜索引擎如Google仍占据绝对主导地位。不过,AI平台产生的"对话曝光"可能远多于实际点击,从对话提及到实际站点访问的转化率约为7%。这部分流量正在增长,但与传统搜索相比仍然微乎其微。

Q5. 控制AI爬虫访问最有效的方法是什么?
实施多层防御策略,组合使用多种方法。使用robots.txt指令向合规机器人传达偏好,配置速率限制以限制单个IP的请求频率,设置防火墙规则屏蔽特定User-Agent或IP范围。如需更高级的控制,Cloudflare等边缘平台可以在网络层面执行规则。请记住,robots.txt依赖自愿合规,因此需要将其与技术执行机制结合使用,才能实现全面防护。

参考文献

[1] - https://commoncrawl.org/faq

[2] - https://commoncrawl.org/ccbot

[3] - https://www.seohero.io/how-to-use-server-logs-to-identify-ai-crawler-behavior/

[4] - https://commoncrawl.org/about

[5] - https://botdetector.io/bots/ccbot/

[6] - https://developers.openai.com/api/docs/bots

[7] - https://blog.cloudflare.com/from-googlebot-to-gptbot-whos-crawling-your-site-in-2025/

[8] - https://ppc.land/openai-revises-chatgpt-crawler-documentation-with-significant-policy-changes/

[9] - https://commoncrawl.org/overview

[10] - https://en.wikipedia.org/wiki/Common_Crawl

[11] - https://dev.to/extractdata/inside-common-crawl-the-dataset-behind-ai-models-and-its-real-world-limits-2eo2

[12] - https://commoncrawl.org/get-started

[13] - https://commoncrawl.org/blog/navigating-the-warc-file-format

[14] - https://searchengineland.com/server-access-logs-seo-448131

[15] - https://docs.oracle.com/cd/E26592_01/doc.1122/e23427/crawler007.htm

[16] - https://www.hostarmada.com/blog/crawler-log-monitoring-alerts/

[17] - https://searchengineland.com/guide/log-file-analysis

[18] - https://www.botify.com/blog/tracking-ai-bots-with-log-file-analysis

[19] - https://stackoverflow.com/questions/10995804/identify-crawlers-from-user-agent

[20] - https://www.searchenginejournal.com/ai-crawler-user-agents-list/558130/

[21] - https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers

[22] - https://www.inmotionhosting.com/blog/ai-crawlers-slowing-down-your-website/

[23] - https://www.parcelperform.com/insights/ecommerce-infrastructure-mapping-bots

[24] - https://developers.google.com/search/docs/crawling-indexing/robots/intro

[25] - https://www.conversios.io/blog/bot-traffic-filtering-and-prevention-guide-for-ga4-and-google-ads/

[26] - https://www.cloudflare.com/learning/bots/what-is-rate-limiting/

[27] - https://ipasis.com/blog/detect-block-bot-traffic-edge

[28] - https://www.firecrawl.dev/glossary/web-scraping-apis/how-web-scraping-apis-handle-rate-limiting-quotas

[29] - https://www.playwire.com/blog/the-complete-list-of-ai-crawlers-and-how-to-block-each-one

[30] - https://developers.cloudflare.com/bots/additional-configurations/managed-robots-txt/

[31] - https://investors.fastly.com/news/news-details/2024/Fastly-Unveils-New-Bot-Management-Solution-to-Help-Detect-and-Block-Threats-at-the-Edge/default.aspx

Related Articles