本文由莫潇羽@源码七号站(www.fuyuan7.com)撰写,转载请注明出处。
快速摘要
2026 年 9 月 15 日,Cloudflare 将正式施行一项震动整个 AI 行业的默认规则:凡是页面上有广告的网站,默认屏蔽「混合用途」AI 爬虫。同一天,去年推出的 Pay Per Crawl(按抓取付费)正式升级为 Pay Per Use(按使用付费)——爬虫抓取内容不再收费,只有抓到的内容真的被 AI 产品引用、展示、使用时才记账。这背后是一套由 Monetization Gateway(支付通道)、爬虫用途拆分与屏蔽、以及 AEO 归因报告组成的「三件套」基础设施。生态合作伙伴中,Ceramic.ai 以 $0.05/1000 次查询的白菜价把搜索层成本压到接近零,为「按使用付费」腾出了经济空间;You.com 则从高端 API 侧切入,为企业 Agent 场景建立按需付费习惯。对 Google 而言,混合爬虫「一次抓取、搜索+AI+训练三份收益」的历史红利被明码标价,被迫拆账;而中小 AI 公司反而因此拉平了起跑线。这场变革的本质不是「帮内容创作者收钱」,而是 Cloudflare 借 publisher 之名、用基础设施定价权对 AI 搜索市场做了一次结构性削平。
想看完整拆解,往下翻。
我是莫潇羽,在源码七号站(www.fuyuan7.com)写技术趋势拆解有几年了。2026 年上半年如果要选一个对整个互联网生态影响最深远的商业决策,我会投给 Cloudflare 7 月 1 日那场发布。
事情的脉络不复杂:去年(2025 年)Cloudflare 搞了个 Pay Per Crawl,允许网站主向 AI 爬虫收费——说白了就是「你抓我内容,你得付钱」。当时业界普遍觉得这是个姿态性的动作,象征意义大于实际。但到了 2026 年 7 月 1 日,Cloudflare 一口气抛出了三样东西,把姿态变成了可以运转的商业机器:Monetization Gateway(支付网关)、x402 开源支付协议的量产落地、以及 9 月 15 日的「混合用途爬虫默认屏蔽」deadline。
我自己折腾技术内容这些年,对「内容被白嫖」这件事有切身体会。写了几天几夜的文章,被爬虫一秒抓走,变成了某个 AI 回答里的一句「据分析……」——读者得到了答案,不会点进原文,而我的网站连个 UV 都收不到。Cloudflare 这次的逻辑不复杂:既然流量模型变了,结算模型也必须跟着变。本文就是我对这套新机制的全方位拆解,从数据、技术原理、商业博弈到独立开发者实操建议,一条条捋清楚。
背景篇:当机器人成为互联网的「多数居民」
在拆解 Pay Per Use 之前,需要先看懂一个底层变化:互联网的流量版图已经被彻底改写。
机器流量首次超越人类:一个被提前到来的拐点
2026 年 6 月 3 日,Cloudflare CEO Matthew Prince 在 X(原 Twitter)上发了一条推文,原话大意是:这件事发生得比我预想的快——我原本以为要到 2027 年底甚至 2028 年初,结果 AI 代理流量增长太快,机器流量已经超过了人类流量,这是互联网历史上的第一次。
就这一句话,被 Forbes、NBC News、TechCrunch 等几十家主流媒体轮番引用,成了 2026 年科技圈被截屏次数最多的 CEO 发言之一。
具体数字是这样的:Cloudflare Radar 的数据显示,截至 2026 年年中,流经 Cloudflare 网络(覆盖全球约 20% 到 23% 的网站)的全部 HTTP 请求中,约 57.4% 来自自动化程序(bots),只有 42.6% 来自真实人类用户。两年前这个比例还倒过来——人类占大头,机器是小头。
更值得关注的是 AI 代理流量的增速。HUMAN Security 发布的《2026 State of AI Traffic》报告给出了一个令人瞠目结舌的数字:Agentic AI 流量同比增长约 7851%,自动化流量的增长速度是人类流量的约 8 倍。这意味着每过一个月,机器产生的请求量就把人类甩开更远一截。
|
指标 |
2024 年中(估计) |
2026 年中(实际) |
变化 |
|
人类流量占比 |
~60% |
~42.6% |
↓ 约 17 个百分点 |
|
Bot 流量占比 |
~40% |
~57.4% |
↑ 约 17 个百分点 |
|
AI Agent 流量同比增速 |
基准年 |
+7851% |
爆发式增长 |
|
Cloudflare 覆盖全球网站比例 |
~20% |
~23% |
持续扩大 |
这个拐点有多重要?它意味着互联网的默认假设要从「服务人类」切换到「服务机器」。以前建网站,默认访客是一个人——他用浏览器打开页面,用眼睛读内容,用鼠标点链接。现在建网站,最大量的访客是一个 AI 代理——它用 HTTP 请求抓页面,用 NLP 提取结构化数据,用向量数据库存 embedding,然后在一个远方的数据中心里把信息喂给某个大模型。
「抓一万次,带回一个人」:AI 爬虫的效率悖论
Cloudflare 官方博客里有一个我反复咂摸的数据:在整个 Web 上,AI 爬虫每给网站带回一个真实访客,中间要发出约 100 到数万次内容请求。
翻译成大白话:一个 AI 搜索产品为了偶尔在答案里引用你网站的一句话,可能已经把你的整个站点爬了几百遍。这些爬取绝大多数不会产生任何「回流」——读者在 AI 界面里看到了答案,不需要点进来源链接,甚至很多 AI 产品根本不提供可点击的来源链接。
Pew Research Center 在 2025 年的一项研究也观察到了类似的趋势:当 Google 搜索结果中出现 AI 生成的摘要时,用户点击传统搜索结果链接的意愿显著降低(详见 Pew 2025 年 7 月发布的「Google users are less likely to click on links when an AI summary appears in the results」)。Ahrefs 在同年的量化分析中给出了更具体的数字——AI Overviews 出现时,排名第一的搜索结果平均点击率下降了约 58%。也就是说,AI 帮用户「消化」了内容之后,大多数场景下用户不会再去原始网页看一眼。
我在源码七号站写文章这几年对此感受非常直观。一篇花两周写的深度拆解,发布后通过搜索引擎来的自然流量明显在逐年下降——不是文章质量不行,是搜索引擎直接把答案贴在搜索结果页上了,读者不需要点进来。
爬虫分类:不是所有 bot 都「坏」
这里需要做一个对新手友好的说明:互联网上的「爬虫」不等于「恶意程序」。Cloudflare 把爬虫分成几种:
- Search bots(搜索爬虫):Googlebot、Bingbot 这类,它们抓页面是为了建搜索索引,长期来看会给网站带来搜索流量。这是传统互联网的「默契」——你让我抓,我给你流量。
- AI training bots(训练爬虫):GPTBot、ClaudeBot、Bytespider 这类,抓页面是为了训练大语言模型。它们不会给网站带来任何回流。
- AI agent bots(代理爬虫):Perplexity、You.com 的爬虫等,抓页面是为了实时回答用户问题。偶尔会给网站带来引用和点击。
- 混合用途爬虫(Mixed-use crawlers):同一个爬虫,同时干搜索、同时喂 Agent、同时喂训练。这在 2026 年 9 月 15 日之前是常态——Googlebot 就是最典型的例子。
问题出在最后一个分类。当同一个 bot 用一个身份做三件事,被爬的网站完全没法区分「这次抓我是为了搜索引擎还是为了训模型」,也没法分别计价。Cloudflare 这次要拆的就是这个。
打个比方:你去超市买东西,同一个购物车里既有自己吃的零食(搜索用途)、也有要送给朋友的礼物(Agent 用途)、还有买来研究包装设计的样品(训练用途),但结账时只扫一个总价码——超市不知道你分别买了什么、分别该收多少钱。Cloudflare 的做法相当于在超市门口装了三个通道:零食走 A 通道、礼物走 B 通道、样品走 C 通道,每个通道有自己的计价规则。先分流,再算账。
原理篇:为什么从「按抓取」改成「按使用」
Cloudflare 去年推出的 Pay Per Crawl 本质上是「按次数计费」:AI 公司的爬虫每抓一次页面,网站主就可以收到一笔极其微小的费用。这个模型听起来合理,跑起来却有两笔账根本算不平。
第一笔算不平的账:一半流量是重复抓取
Cloudflare 官方给了一个非常刺眼的数据:在 "good bot"(非恶意的合规爬虫)产生的流量中,超过 50% 是在重抓没有发生任何变化的页面。
想象一下:你写了一篇技术文章,发布后三个月没有改过一个字。但 AI 爬虫可能已经来抓了 30 次、50 次、100 次——因为不同的 AI 产品、不同的用户查询、不同的模型版本,都在重复拉取同一份内容。如果按「抓一次付一次」来结算,AI 公司要为一堆根本没用的重复流量付钱,而网站主收到的钱里也有一半对应的是无意义的重复劳动——双方都在为「噪音」付账。
用伪代码来表达这个逻辑会更直观:
# Pay Per Crawl 的问题:重复抓取也被计费
page_content = fetch_url("https://example.com/article/123")
page_hash = md5(page_content)
# 第一次抓:计费 ✓
charge(ai_company, publisher, rate=0.001) # $0.001 per crawl
# 30 天后,页面没变,但又被抓了
page_content = fetch_url("https://example.com/article/123")
new_hash = md5(page_content)
if new_hash == page_hash:
# 内容完全相同,但 Pay Per Crawl 仍然计费 ✗
# 这对 AI 公司和 publisher 都没有价值
charge(ai_company, publisher, rate=0.001) # 冤枉钱
这就是「按抓取付费」的第一个致命缺陷:它计量的是动作(有没有抓),而不是价值(抓到的内容有没有被用到)。
第二笔算不平的账:抓取量与实际引用的鸿沟
再回头看那个「抓一万次,带回一个人」的比例。
假设一个中型技术博客每天被各类 AI 爬虫抓取 20000 次,其中只有 2 次最终出现在某个 AI 产品的回答引用里,给网站带来了 1 个真实点击。如果按每次抓取 $0.001 计算,AI 公司一天要付 $20,一年是 $7300——但这 20000 次抓取里 19998 次对 AI 公司来说是「库存」,根本没被用上。AI 公司不愿意为库存付钱,网站主也清楚自己的内容在 AI 生态里的真实价值远不止每天 $20——因为如果那 2 次引用帮 AI 产品解决的是高价值查询(比如「2026 年 AI 爬虫政策的最新变化」),它创造的商业价值远高于几分钱。
Pay Per Use 的解决思路干脆利落:抓取本身免费,只有当内容真的被 Agent 引用、被搜索结果展示、被用于回答用户查询时,才按使用次数结账。
# Pay Per Use 的计费逻辑(简化版)
crawl(url) → 免费(不计费)
store_in_index(url) → 免费(不计费)
use_in_answer(url) → 计费 ✓ (每使用一次,AI 公司付一次)
show_in_results(url) → 计费 ✓ (每展示一次,AI 公司付一次)
# 关键:谁用了、用了几次、值多少钱,全部需要归因
这套逻辑背后藏着一个非常朴素但一直被忽视的商业常识:为结果付费,而不是为过程付费。 我在自己的知识付费和内容创作经历中也反复体会到这一点——读者愿意为一篇解决了他实际问题的文章付费,但不会为你「写文章的过程」付费。Cloudflare 只是把同样的逻辑搬到了机器对机器的结算层面。
一个容易被忽略的细节:Pay Per Use 不是 Pay Per Crawl 的「升级」,而是「推倒重来」
外面很多报道把 Pay Per Use 描述成 Pay Per Crawl 的「迭代版本」,但两者底层的结算哲学完全不同。Pay Per Crawl 是「按投入收费」——你抓了,无论用不用,都得付。Pay Per Use 是「按产出收费」—