網路架站

2026 AI 爬蟲授權大洗牌:網站站長終於有得談嗎?

本篇內容更新/查核

2026年08月09日

  1. 更正:Cloudflare 9 月 15 日的爬蟲新預設,僅自動套用於新加入的客戶、既有客戶新開的網站,以及所有免費方案客戶;既有付費客戶的既有網站不會自動套用,需自行到後台調整。
  2. 更正:出現 AI 摘要時,傳統搜尋結果連結的點擊率降到 8%,比沒有摘要時的 15% 少了將近一半。
  3. 更正:機器可讀的授權標準分成兩套——RSL 是在 robots.txt 放一行 License 欄位指向一份授權文件,文件裡分項標明訓練、推論等用途是否開放;Cloudflare 另外提出的 Content Signals,才是直接在 robots.txt 用 Content-Signal 欄位對搜尋、訓練、引用個別表態,兩者是不同標準。
  4. 更新:News/Media Alliance 代表旗下中小型出版商,已先後與兩家 AI 公司談成集體授權協議,收益同樣採五五分潤。
  5. 更正:台灣目前可依循的規範,是智慧財產局陸續發布的幾則函釋。

多數人以為,爬蟲抓得越兇,網站站長能講價的空間就越小。2026 年 6 月,Cloudflare 公布的數據顯示,全球網路上自動化流量首度超過人類流量,機器人佔了 57.5%,人類只剩 42.5%;Cloudflare 的執行長 Matthew Prince 也坦言,這個時間點來得比公司內部原本的預測還早。照這個走勢推算,內容創作者手上能不能談成 AI 爬蟲授權,理應只會越來越難才對。

但同一年,Cloudflare 反而做了一件跟這個走勢反著來的事。它把過去混在一起的「幫搜尋引擎建索引」跟「幫 AI 模型做訓練、替使用者當代理跑腿」這兩種爬蟲行為徹底分家,也把「按次收費」從先前小規模的私測,一口氣推成所有客戶都能用的預設政策。9 月 15 日起,連身分不明的混合型爬蟲,只要出現在有廣告的頁面上,就會被預設擋在外面。不過這組新預設只自動套用在新加入的客戶、既有客戶新開的網站,以及所有免費方案客戶身上;既有付費客戶的既有網站不會自動改變,要自己進後台調整才會生效。爬蟲流量越是洶湧,網站站長手上第一次多出一個過去沒有的選項,要不要跟這些抓內容的爬蟲開價。

搜尋爬蟲與訓練爬蟲,2026 年被迫分道揚鑣

過去一支爬蟲身兼兩份工作是常態,它一邊替搜尋引擎建索引,讓網頁在搜尋結果裡被找到,一邊也把同一批內容搬去訓練或微調 AI 模型。網站站長除了整支放行或整支擋掉,中間沒有別的選項,沒辦法只答應「我願意被搜尋到」,卻拒絕「我的內容被拿去練模型」。

Cloudflare 從 2026 年起把這件事拆開來管,將爬蟲行為分成三種身分:搜尋,指的是「蒐集或索引內容,以便日後回答相關問題」,做的是建資料庫供查詢;代理,指的是「即時代表使用者執行任務的自動化行為」,像 ChatGPT-User、Gemini 這類會臨時造訪網頁、完成一次性任務的代理程式;訓練,則是「爬取內容用來訓練或微調模型」,一旦抓進去,資料就永久融進模型架構裡,拿不回來。9 月 15 日起,面對同時具備多種行為的混合型爬蟲(例如身兼多職的 Googlebot),Cloudflare 會把它「全部的行為」放在一起管,只要頁面含廣告,訓練與代理這兩類就被預設擋下來,就算這支爬蟲同時也在做搜尋,一樣會被擋;只有純粹的搜尋行為,才仍然維持預設放行。

Cloudflare 把 AI 爬蟲拆成搜尋、代理、訓練三種身分,含廣告頁面預設只放行搜尋,代理與訓練都被擋下
Cloudflare 把爬蟲拆成搜尋、代理、訓練三種身分後,含廣告的頁面預設只放行搜尋,代理與訓練一律預設擋下。

連帶被重新定義的,還有「Verified(已驗證)」這個身分。過去 Verified 幾乎等於預設放行,現在它只代表這支爬蟲誠實自報身分、也沒有濫用取得的存取權,最終放不放行,要看網站站長開了哪個分類的門,已驗證只是取得被考慮的資格,不再直接等於通關;會把整段內容原封不動複製走的爬蟲,連 Verified 資格都拿不到。

把訓練跟搜尋拆開,Cloudflare 不是第一家這麼做的業者。Google 早在 2023 年 9 月就推出 Google-Extended 這個獨立標記,讓網站站長可以只擋「訓練 Gemini 模型」跟「Gemini 產品的接地引用」,不影響網頁繼續被 Google 搜尋收錄與排名,等於當時就先示範了同一套邏輯,只是那時只有 Google 自己一家在做,如今才換成基礎設施商把它做成整個產業都能用的預設值。

內容換流量的公式斷裂,網站站長想跟 AI 爬蟲收費

網站站長不是突然變貪心,是「內容換流量、流量換收入」這條舊公式正在斷裂,帳越算越不划算。

Pew Research Center 一份分析美國九百名受訪者實際瀏覽紀錄的研究發現,搜尋結果裡只要跳出 AI 摘要,使用者點進傳統搜尋結果連結的比例就掉到 8%,比沒有摘要時的 15% 少了將近一半;會再點進摘要本身連結的比例更低,只有 1%。看到 AI 摘要後,使用者乾脆什麼連結都不點、直接結束這次搜尋的比例也來到 26%,高於沒有摘要時的 16%。而在這份研究涵蓋的搜尋裡,有 18% 會跳出 AI 摘要,也就是說,使用者已經越來越習慣在搜尋結果頁就拿到答案,不必再點進原始網站。

搜尋結果出現 AI 摘要時,點進傳統連結的比例從 15% 降到 8%,看完直接離開的比例則從 16% 升到 26%
搜尋結果一出現 AI 摘要,點進傳統連結的比例幾乎砍半、直接離開的比例反而變多(資料來源:Pew Research Center)。

流量流失只是帳的一半,另一半是抓取本身的成本。AI 相關爬蟲的抓取量成長速度遠遠超過人類流量,但 Cloudflare 自己的數據顯示,這些爬蟲有超過一半的請求,只是在重複抓取根本沒有更新的頁面,網站的頻寬與主機資源,有一大截其實是被這種沒有意義的重複抓取白白耗掉的。內容被拿走卻換不回等值的回報,正是網站站長開始想跟 AI 爬蟲收錢的起點。

議價籌碼來自三股正在成形的力量

AI 爬蟲授權的議價位置,目前看得到的至少有三股力量同時在成形:一個是基礎設施商把「擋」變成「開價」的機制,一個是讓「開價」能規模化複製的機器可讀授權標準,一個則是內容產業自己靠談判與訴訟兩手,實際逼出真金白銀的金額。三股力量彼此互補,只是籌碼分布並不平均,規模越大的一方,能拿到的談判空間也越大。

網站站長的 AI 爬蟲議價籌碼來自三股力量:基礎設施商的收費機制、機器可讀授權標準,以及內容產業的談判與訴訟
議價籌碼由三股力量共同撐起——收費機制、授權標準、談判與訴訟,但規模越大的一方能拿到的談判空間也越大。

Cloudflare 把「擋爬蟲」升級成「開價」

Pay per crawl 的運作邏輯,說穿了就是把一次爬取請求變成一筆交易。AI 爬蟲送出請求時,如果沒有表明付款意願,先收到的是一個 HTTP 402「需要付款」的回應,裡面附上這篇內容的報價;爬蟲如果願意付這個價,就在下一次請求裡帶上同意付款的標頭重新請求,這次換來的才是 200 的正常回應與完整內容。網站站長對每支爬蟲有三個選項,放行、收費,或整支擋掉。Cloudflare 在這筆交易裡同時扮演兩個角色,一邊是收款與分潤的商戶,一邊是把規則接進既有安全設定裡執行的技術基礎設施提供者。

Pay per crawl 流程:爬蟲首次請求先收到 HTTP 402 報價,帶上付款標頭重送後,才換來 HTTP 200 的完整內容
Pay per crawl 把一次爬取變成交易:伺服器先回 402 附上報價,爬蟲帶付款標頭重送,才換到 200 的完整內容。

這套機制在 2025 年 7 月先以私測形式推出,一年後演化出更細緻的第二代玩法,叫 Pay Per Use。兩代機制收費的判準不一樣,上一代是「每抓一次就收一次錢」,不管內容有沒有真的被用到;Pay Per Use 則只有當這篇內容真的被引用進 AI 聊天機器人回答使用者的最終答案裡,AI 公司才需要付錢。目前 Cloudflare 先找了 Ceramic.ai 與 You.com 兩家試辦這套按實際引用付費的模式。

機器可讀的授權標準,開始補上最後一哩路

光有「收費開關」還不夠,怎麼讓一個網站的授權條件能被全世界的 AI 爬蟲讀懂,又不用一一簽約談判,才是真正能不能規模化的關鍵。RSL(Really Simple Licensing)這套開放標準要解決的正是這個問題,讓網站站長直接在 robots.txt、網頁的 HTML,或是 RSS 裡掛上機器可讀的授權條款。做法上,站長在 robots.txt 放一行 License 欄位指向一份授權文件,文件裡再分項寫清楚訓練能不能用、推論(也就是被拿去回答問題時能不能引用)能不能用,以及要用訂閱制還是按次計費;想單純禁止某種用途的,也是在同一份文件裡把該用途標成禁止。要留意的是,另一種「直接在 robots.txt 寫一行,就分別對搜尋、AI 訓練與 AI 引用表態」的做法,用的欄位叫 Content-Signal,那是 Cloudflare 自己提出的 Content Signals,跟 RSL 是兩套不同的東西,別混著用。

TollBit 則從另一個角度切入,直接做成一套機器人付費牆服務,接在網站原有的爬蟲偵測與內容傳遞流程後面,偵測到來的是 AI 爬蟲,就把它導向一個付費頁,並依授權類型分開計價:只授權拿去摘要或引用的摘要引用授權,跟授權完整顯示全文的全文顯示授權,價格不一樣,出版商可以分別按每千次存取設定費率。出版商保留全部訂價權,TollBit 只在每筆交易上抽一筆手續費。這套服務目前已經接進三千多個網站,包括 TIME、Fast Company 這類國際媒體。

大型出版商靠談判和訴訟拿到授權金,中小型網站還在等

籌碼分布不平均這件事,在出版產業裡最明顯。有規模、有獨家內容的大型出版商,有的直接坐上談判桌談出授權金,有的則透過訴訟施壓,兩手都在真的逼出實際金額;沒有規模、沒有獨家內容的中小型網站,多半只能被動接受基礎設施商給的預設選項。

News Corp 和 OpenAI 之間簽下的這筆多年期合作案,是目前最常被引用的國際案例,涵蓋《華爾街日報》、《紐約郵報》等多個媒體品牌的內容,讓 OpenAI 可以在回答使用者問題時使用,也用來精進自家產品。外界估計,這筆合作五年下來價值可能超過 2.5 億美元,不過確切金額並未在公開文件中證實。這筆交易的談判籌碼,來自獨家、跨國、長期累積下來的內容資產,這是一般網站幾乎不可能複製的條件。

規模不夠大的出版商,也不是完全沒有出路。News/Media Alliance 這類產業公協會,代表旗下兩千兩百多家中小型出版商,先後跟兩家做 AI 的公司談成集體授權協議,把因內容而生的收益分一半給出版商,讓原本沒有單獨談判籌碼的小型出版商,也能共享一部分 AI 授權收益。不過這條路也有天花板,多家出版商聯合起來對同一個買家談條件,很容易被視為聯合定價,踩到反壟斷法的紅線;這也是美國國會過去幾年一直討論要不要通過《新聞業競爭與保存法案》,讓新聞媒體能在有期限內免受反壟斷法規範、集體協商的原因,目前這項法案還沒有真正通過。

台灣網站內容被拿去訓練 AI,法律定位仍不明朗

前面談的授權機制,多半是美國大型出版商跟 AI 公司之間的商業安排,對台灣網站站長來說,更實際的問題是,自己現在的法律立足點站在哪裡。

經濟部智慧財產局的見解是,把受著作權保護的內容輸入 AI 模型做訓練,本身會落入重製的範疇;除非符合著作權法第 44 條到 65 條列出的合理使用情形,否則原則上需要取得著作權人的同意或授權。問題是,這些合理使用條款大多設有合理範圍、必要範圍這類限制,對 AI 動輒抓取海量資料的需求,適用起來並不容易。

跟日本、歐盟比,台灣目前也沒有專門替資料探勘訂出的明確豁免條款。日本著作權法第 30 條之 4 開放在特定目的下使用著作,包括開發資訊技術、進行大量素材分析,不過也限定不能用於欣賞受保護作品本身的思想或情感表達;歐盟則是在 2019 年的著作權指令裡替資料探勘設了兩層例外:研究機構做學術研究可以直接適用;一般用途(包括商業使用)也開放,但搭配一套權利人可以主張退出的機制當作平衡。台灣目前只能依循智慧財產局陸續發布的幾則函釋,法律的明確性上仍有努力空間。

資料探勘著作權比較:台灣沒有專門豁免、僅智財局函釋,日本有著作權法第 30 條之 4 例外,歐盟有兩層例外加退出機制
同樣是把內容輸入 AI 訓練,日本、歐盟都設有明確例外,台灣目前只能依循智財局陸續發布的幾則函釋、規範最不明確。

對一般網站站長而言,這也代表在法規真的補上之前,能主動做的表態,現階段其實只剩下爬蟲分類設定這一項,不是坐等哪天有 AI 公司主動找上門簽授權合約。像 Cloudflare 把爬蟲拆成搜尋、代理、訓練三種身分分別開關,就是台灣中小型網站的站長目前唯一能主動按下的按鈕。

AI 爬蟲流量正處在歷史新高,內容被抓取的胃口只會更大,不會轉頭往回走。但 AI 爬蟲授權的議價位置,第一次真的落在網站站長這一邊,不必等法規補齊,也不必等大公司先談出一套規則才輪得到自己。分類設定、機器可讀的授權標準、集體授權,都還是正在成形中的工具,沒有哪一項已經定案。愈早搞懂自己的內容被歸在哪一種身分、愈早決定要擋、要談,還是要開價,就愈早卡到有利的位置;晚一步才進場的網站,屆時面對的很可能已經是別人談好、自己只能照單全收的規則。

常見問答

本區問答由 AI 依文章內容自動整理,僅供快速參考,正式內容仍以全文為準。

混合型爬蟲在廣告頁面會被怎麼處理?

只要頁面含廣告,Cloudflare 就會把混合型爬蟲的所有行為視為一體,訓練與代理這兩類預設會被擋下;就算同一支爬蟲也在做搜尋,一樣會被擋,只有純粹的搜尋行為才維持預設放行。

搜尋結果出現 AI 摘要時,點進原始連結比例掉到多少?

Pew Research 的研究發現,搜尋結果出現 AI 摘要時,使用者點進傳統搜尋結果連結的比例掉到 8%,不到沒有摘要時 15% 的一半;如果只看點進摘要本身連結的比例,更只剩下 1%。

Pay per crawl 請求內容,會先收到什麼回應?

AI 爬蟲送出請求若沒有表明付款意願,會先收到 HTTP 402「需要付款」的回應,並附上這篇內容的報價;爬蟲若願意支付,下一次請求時會帶上同意付款的標頭,才能換來 200 的正常回應與完整內容。

RSL 這套標準怎麼讓授權條款變成機器可讀?

RSL(Really Simple Licensing)讓站長在 robots.txt、網頁 HTML 或 RSS 掛上機器可讀的授權條款:放一行 License 欄位指向授權文件,文件裡再分項標明訓練、推論等用途是允許還是禁止。

台灣網站把內容餵給 AI 訓練,算著作權侵害嗎?

經濟部智慧財產局認為,把受著作權保護的內容輸入 AI 模型訓練屬於重製行為,除非符合著作權法第 44 條到 65 條列出的合理使用情形,否則原則上需要取得著作權人的同意或授權。

資料來源
  1. Bot Traffic Worldwide(自動化流量首度超越人類流量數據) — Cloudflare
  2. Your site, your rules: new AI traffic options for all customers — Cloudflare
  3. Introducing pay per crawl: Enabling content owners to charge AI crawlers for access — Cloudflare
  4. Making AI search smarter — Cloudflare
  5. An update on web publisher controls(Google-Extended 推出公告) — Google
  6. Do people click on links in Google AI summaries? — Pew Research Center
  7. Really Simple Licensing (RSL) 1.0 Specification — RSL
  8. TollBit - Bot & Agent Paywall — TollBit
  9. A landmark multi-year global partnership with News Corp — OpenAI
  10. News/Media Alliance Partners with Bria AI to Launch Industry-Leading AI Licensing Agreement — News/Media Alliance
  11. 智慧財產局著作權主題網-解釋資料檢索(AI訓練輸入著作涉及重製之見解) — 經濟部智慧財產局
  12. AIと著作権に関する考え方について(著作權法第30條之4資訊解析例外解說) — 日本著作權法
  13. DIRECTIVE (EU) 2019/790(歐盟數位單一市場著作權指令) — 歐盟