AI 爬你的網站,Cloudflare 讓你分三種處理:搜尋放行、訓練和代理可擋可收費,9/15 起有廣告的頁面預設擋
「要不要讓 AI 抓」從一個開關,變成三個
把你的網站想成一家餐廳。有三種人會上門:帶團來吃飯的導遊、把菜單整本抄回去自己開店的同行、還有替客人打包外帶的跑腿——客人自己從頭到尾不進門。
過去你門口只能掛一塊牌子:全部歡迎,或一律謝絕。7 月 1 日起,Cloudflare 讓你分開招呼這三種人。導遊(Search,會把人帶回來的搜尋爬蟲)請進;抄菜單的(Training,拿內容去訓練模型)和跑腿的(Agent,即時替使用者抓答案),你可以擋在門外,或者,收錢。
規則真正翻面是在 9 月 15 日。那天起,一批網站的預設值會自己改變——不用你動手,也不問你。
9 月 15 日的新預設:掛廣告的頁面,先擋再說
新預設只有一句話:有顯示廣告的頁面,Training 與 Agent 預設封鎖,Search 維持放行。
Cloudflare 的邏輯不難懂。頁面上掛廣告,代表這頁是做給人看、靠人變現的;那就預設擋掉不帶人回來的爬蟲,留下會帶引用和流量回來的。用餐廳的話說:店裡的收入靠客人進門消費,那抄菜單和純外帶的就別預設放行了。
範圍要看仔細,這個預設只套用三種對象:新加入 Cloudflare 的客戶、既有客戶新增的網站、以及所有既有的免費方案客戶。付費方案的既有網站維持原設定,要改得自己去後台調。換句話說,最容易「被自動改設定」的,是免費方案又掛廣告的小站——而那正是最沒空盯這件事的一群人。
Cloudflare 給這個動作的理由,是一句挺重的話:撐了大約 30 年的默契——你讓我的爬蟲抓,我把流量帶回來給你——已經不成立了,因為近期 bot 流量首度超越真人流量。爬蟲比人多的網路上,舊的交換條件自然要重談。
三類爬蟲的定義與預設
三類的分法只看一件事:它拿你的內容去做什麼、會不會給你回報。定義與預設皆出自 Cloudflare 官方說明:
| 類別 | 它在做什麼 | 典型例子 | 9/15 起有廣告頁的預設 |
|---|---|---|---|
| Search(搜尋) | 收集、索引內容以便日後回答問題,通常帶回引用與導流 | 傳統搜尋引擎索引 | 放行 |
| Agent(代理) | AI 即時代使用者去完成一件事 | chat 抓取、browser-use 代理 | 封鎖 |
| Training(訓練) | 內容被拿去訓練或微調模型、永久吸收進模型 | 模型訓練爬蟲 | 封鎖 |
一句話記住這張表:Search 會把人帶回你的網站,另外兩類通常不會。 訓練是把內容一次吸進模型,之後跟你無關;代理是替某個使用者當下取走答案,那個人多半不會再點進你的頁面。Cloudflare 的預設,就是沿著「有沒有回頭客」這條線切的。
麻煩在 Googlebot:兩棲爬蟲以最嚴規則判定
真實世界的爬蟲沒那麼安分。Googlebot、Applebot、BingBot 這類混合用途爬蟲,同時做搜尋索引和訓練資料收集——導遊兼抄菜單。
Cloudflare 的處理是一刀切:混合爬蟲依它的所有行為判定,以最嚴規則為準。你若選擇擋訓練,這些爬蟲會被一併擋掉,即使它同時也在做你想要的搜尋索引。
對靠搜尋流量吃飯的網站,這是全篇最需要想清楚的一段。擋掉訓練,可能連帶影響混合爬蟲對你的搜尋索引或 AI 搜尋引用;官方沒有保證兩者可以兼得。要擋 AI 拿去訓練,還是保住被搜尋引用的機會——答案取決於你的流量主要靠哪一邊,而且可能得實測才知道代價。
收費這條路:從按次抓取,到被用進答案才計費
擋之外的另一條路是收錢。Cloudflare 原本就有 Pay Per Crawl:爬蟲每抓一次你的頁面,付一次錢。這次它把方向推向 Pay Per Use——你的內容真的被用進 AI 生成的答案或搜尋結果,才觸發計費。前者按抓取次數,後者按實際使用;對內容方,後者顯然更接近「內容產生價值才分錢」。
目前公開的合作夥伴只有兩家:Ceramic.ai 與 You.com。內容出現在 Ceramic 的 AI 搜尋結果、或 You.com 存取付費內容時,出版方可以分潤。就這兩家,機制還早,別把它當成馬上能開來收錢的水龍頭。
9/15 前,三種人各自要看一眼的事
做內容、媒體或 SEO 的人:
- 去 Cloudflare 後台看現在的 AI bot 設定,確認新預設會不會動到你——免費方案加掛廣告頁最容易中。
- 先想清楚「擋訓練」和「保住 AI 搜尋引用」哪個重要,混合爬蟲的最嚴規則會逼你選邊。
- 想收費就去看 Pay Per Crawl/Pay Per Use,但知道夥伴目前只有兩家。
一般網站主或電商:
- 確認有沒有掛廣告的頁面,那是預設封鎖的觸發條件。
- 決定要不要讓 agent 抓——比價、客服代理都算;擋掉可能少了 AI 導購來源,放行則內容被即時取走。
自己寫 agent 的人:
- 你的爬蟲會被歸為 Agent 類,9/15 起在有廣告的頁面可能被預設擋,先測目標站點還抓不抓得到。
- 別假設以前抓得到、以後就抓得到;「目標站開始擋或要求付費」要當成正常情況來處理。
最後記兩個邊界:這一切只影響用 Cloudflare 的網站;而封鎖與收費的實際執行力、AI 公司會不會乖乖付錢,目前還沒有成效數據。餐廳的三個門已經裝好了——接下來幾個月,就看誰真的在門口掏錢。
資料來源:Cloudflare 官方部落格「Your site, your rules: new AI traffic options for all customers」、「Introducing pay per crawl」、TechCrunch、Engadget。
SOURCES
- A Your site, your rules: new AI traffic options for all customers
- A Introducing pay per crawl: Enabling content owners to charge AI crawlers for access
- B Cloudflare's new policy pushes AI companies to pay for publishers' content
- B Cloudflare will filter out web crawlers that serve AI companies
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明