Cloudflare 的新一轮 AI 流量控制,表面上是在给站长增加几个开关;对爬虫行业而言,它实际改变了一个更基础的问题:自动化客户端不再只需要证明“能访问”,还需要说明“是谁、为何访问,以及内容会被如何使用”。
这并不意味着网页数据采集会消失。公开信息监测、价格追踪、搜索索引、无障碍检测、RSS 聚合和用户授权的网页操作仍然有真实需求。但以匿名身份、大量请求和单一爬虫承担多种用途为核心的模式,面临的成本与不确定性正在上升。
本文解释这一变化对整个爬虫行业意味着什么,并区分已经落地的事实与未来 12 至 24 个月的趋势判断。
这次 Cloudflare 到底改变了什么?
2026 年 7 月,Cloudflare 将原先较笼统的“Block AI bots”控制,升级为按行为管理的三类预设:
- Search:收集或索引内容,以便以后回答搜索问题。
- Agent:代表用户实时访问页面并完成任务,例如聊天抓取或浏览器 Agent。
- Training:采集内容用于训练或微调模型。
这些控制不只针对已验证机器人,也会覆盖被识别为对应行为的其他自动化流量。站长可选择全站阻断、仅在含广告页面阻断,或允许访问。Cloudflare 的官方文档还明确说明:兼具 Search 与 Training 的混合用途爬虫,可能受训练策略影响。详见 Cloudflare 的 AI bot policy 文档。
9 月 15 日之后,Cloudflare 又引入了更细的路径:站点可以在保留搜索收录的同时,表达“不允许 AI Training”的偏好;混合用途爬虫是否仍能用于搜索,取决于其是否提供并遵守相应的分离与选择机制。这个变化的重点不是“所有机器人默认被封”,而是站点可以开始把搜索可发现性、AI 训练与 Agent 访问拆开决策。Cloudflare 的后续公告 对这套迁移逻辑有详细说明。
行业的核心变化:从 IP 对抗转向用途协商
传统反爬对抗主要围绕 IP、User-Agent、Cookie、浏览器指纹、速率和验证码展开。它们仍会存在,但 Cloudflare 正在把另一组维度推到前台:身份真实性、操作方、用途分类、内容留存方式,以及是否遵守站点偏好。
可以把新格局理解为三层:
| 层级 | 过去的主要问题 | 正在出现的新问题 |
|---|---|---|
| 访问能力 | 请求能否成功到达页面? | 请求身份是否可识别、稳定且可验证? |
| 使用目的 | 机器人是不是“好机器人”? | 它在做搜索、实时 Agent、训练、价格采集还是监控? |
| 内容权利 | 是否允许抓取? | 可否保存、索引、摘要、再发布或用于训练? |
这对“能否抓到 HTML”以外的部分提出了要求:数据服务商必须管理数据来源、抓取目的、保存期限和下游再利用方式。
对不同爬虫赛道的影响
1. 通用网页抓取 API:成功率不再是唯一卖点
托管抓取 API 的价值长期集中在渲染 JavaScript、处理会话和提高请求可用性。今后,客户会更常问两个额外问题:该请求是否符合目标网站的自动化访问偏好?采集后的内容能否进入知识库、摘要产品或模型训练流程?
因此,成熟的平台需要从“返回页面内容”升级为“返回带来源与用途边界的数据”。例如,任务级用途标签、robots.txt 与站点条款记录、阻断原因分类、缓存期限和审计日志,会逐渐成为企业采购时的重要能力。
2. 价格监控与竞争情报:暂不是本轮主开关,但会进入精细治理
Cloudflare 在 BotBase 的行为分类中已单独列出 Data Collection,包括价格抓取、竞争情报和第三方分析;但目前向所有套餐开放的 AI 流量预设主要仍是 Search、Agent 和 Training。Verified bots 文档 同时列出了这两层分类。
这意味着价格监控不会因为这次更新自动失去生存空间,但它已被纳入可识别、可度量的自动化行为体系。对高频抓取、商业价值高或广告变现明显的页面,站点未来更可能设置专门的访问规则、限额、数据接口或商业许可。
3. AI 数据与 RAG:用途混合会成为最大合规风险
很多采集工作流一开始是“为客户检索资料”,后来数据被长期保存、建立向量索引,甚至用于训练。技术上这可能只是一次数据管线配置变化;在新治理模型里,它们对应的却是不同用途。
这要求 AI 数据服务和 RAG 产品至少能区分三件事:一次用户发起的即时页面读取、可回链的索引或引用、以及会永久改变模型能力的训练数据。若无法区分,服务商既难向站点解释自身行为,也难向企业客户说明数据权利边界。
4. 浏览器 Agent:模拟真人不等于获得长期准入
Agent 代表用户实时执行网页操作,与离线批量爬取不同,但 Cloudflare 已将其作为独立类别管理。未来,浏览器自动化提供商不能只依赖“请求看起来像真人浏览器”。更可能的方向是:平台需要证明代理谁发起访问、请求经过了哪些中间层、是否保持合理速率,以及是否只处理完成任务所需的数据。
Cloudflare 已在探索将直接运营者与中介型 Agent 区分,并尝试通过 Forwarded 头传递更完整的责任链。这不是一项通用互联网标准的最终形态,但它清楚地显示出基础设施层对“代理访问责任归属”的关注。Cloudflare 的验证机器人说明 将这种模式称为 transitive trust。
5. 代理网络:从“更多 IP”转向“更可证明的请求”
代理仍将承担地域访问、会话连续性、网络可靠性和容量调度等作用。但单靠频繁更换 IP 来隐藏自动化特征,难以成为长期产品壁垒:它不能解释采集目的,也不能获得站点所有者的信任。
更有价值的能力将是稳定的网络身份、明确的操作方声明、按客户和用途隔离的请求链路、可审计日志,以及在授权场景下可验证的机器人身份。Cloudflare 对 Verified Bot 的要求也沿着这一方向:诚实自我标识、合理速率、遵守 robots.txt 和不规避网站偏好。官方验证条件 已明确列出这些要求。
为什么这不是“Cloudflare 封杀爬虫”
将这次更新理解成“Cloudflare 要封所有爬虫”并不准确。
第一,Cloudflare 明确保留了对 Search、RSS、监控、SEO、广告验证等自动化需求的分类空间。第二,站长拥有的是更细的选择权,而不是强制统一策略。第三,许多合法数据需求本来就更适合通过 API、数据导出、联盟合作、RSS、站点授权或付费许可获得。
真正被压缩的,是“任何公开页面都可以被不透明地大规模采集、永久留存并任意再利用”的默认假设。行业的挑战不是找到永远有效的规避手段,而是在站点、数据服务商和最终使用者之间建立更低摩擦的访问协议。
未来 12–24 个月的五个趋势判断
以下是基于 Cloudflare 已发布能力和路线图做出的行业分析,并非 Cloudflare 的已公布承诺。
1. 用途分类会从三类扩展到更多垂直场景
Cloudflare 已在 BotBase 中列出交易、数据采集、安全测试、SEO、广告验证、社交预览、Feed 和监控等行为。下一步最可能发生的不是所有类别同时默认阻断,而是站长逐步获得针对高价值类别的配置、分析与商业规则。
2. 可信身份会成为大型爬虫的基础设施
Web Bot Auth、稳定 IP 清单、反向 DNS 和可验证 User-Agent 代表的并非单一产品功能,而是一种行业身份层。大型搜索、Agent 和数据服务商将越来越需要证明“请求确实来自我,而且符合我宣称的用途”。
3. robots.txt 会继续存在,但不足以单独解决问题
Cloudflare 正将其控制同步到 robots.txt,并为内容用途增加机器可读表达。但 robots.txt 本质上是声明,不是强制执行。未来更可能是“声明标准 + CDN/WAF 识别与执行 + 运营方可验证身份”的组合,而不是单一文件解决一切。
4. 数据访问会出现更多按用途定价与授权模式
对新闻、研究、商品、专业数据库等高价值内容,站点会更频繁地提出“可以搜索、不可训练”“可以实时访问、不可批量归档”“可以摘要、需回链”等差异化条件。API、付费抓取、内容授权、联盟数据与结果回链,会成为公开抓取以外越来越重要的供给方式。
5. 爬虫服务会分成三种定位
- 开放合规采集:面向公开允许的页面、Feed、API 和可明确说明用途的数据任务。
- 授权数据访问:通过合作、合同、按次调用或数据许可获取稳定供给。
- 高对抗采集:主要依赖规避识别和持续攻防,成本、法律风险与交付不确定性都会增加。
长期来看,前两类更容易形成可持续的企业服务;第三类短期仍有需求,但难以作为稳健的数据基础设施承诺。
给爬虫平台与数据团队的行动清单
- 为任务定义用途:区分实时用户请求、索引、价格监控、研究与训练,不让一种采集任务默认流向全部下游用途。
- 记录来源与访问偏好:保留 robots.txt、站点规则、授权记录与抓取时间,方便处理争议和客户审计。
- 拆分请求身份与队列:不同用途使用不同的速率、缓存、保存期限和运营说明,避免一个模糊身份承担所有工作。
- 把阻断做成可观测信号:区分网络故障、限流、挑战页、策略封锁和授权失效,而不是只统计“请求失败”。
- 提前设计授权路径:对高价值或高频目标,为 API、RSS、数据合作、站点白名单和付费访问保留产品接口。
结语
Cloudflare 的新规则不是爬虫行业的终点,而是行业成熟化的信号。过去,竞争更多发生在访问技术的对抗层;未来,竞争会同时发生在身份可信度、用途透明度、内容权利管理和数据供给关系上。
对网页数据采集服务商来说,最重要的能力将不只是“替客户拿到页面”,而是帮助客户以可持续、可解释、可审计的方式获得并使用数据。能够把这四件事做好的公司,更可能在 Agent 和 AI 搜索加速普及的下一阶段建立长期优势。