
我的提示詞會被拿去訓練嗎?訓練、保留、真人看是三件事
便宜那一格的價差,就是資料的標價
同一顆模型、同一張官方價目表,兩格價錢差 12.5 倍。差的不是效能,是一句授權。
Meta 的 Model API 定價頁上,muse-spark-1.3 標準檔輸入每百萬 token 1.25 美元、輸出 4.25 美元,旁邊那行寫著這一檔不會把你的提示詞與完成內容拿去訓練 Meta 的模型。下面那格叫 contributor,同一顆模型,輸入 0.10、輸出 0.20,官方給的說明是「大幅折扣的 token 價格,換取使用你的提示詞與完成內容訓練未來 Meta 模型的授權」。輸入差 12.5 倍、輸出差 21.25 倍、快取輸入差 75 倍(三個倍數是我拿官方那兩格單價相除得出的)。
這種價目表現在不只一家。要看懂它,得先把三個常被混成一件事的詞分開。
資料換折扣指的是:服務商把「能不能拿你的提示詞與輸出去訓練模型」做成價目表上的一格,願意授權的人付比較少的錢,或者不付錢。它跟「你的內容會不會被保留」「會不會有真人讀到」是三件互相獨立的事——一份條款可以三件全中,也可以只中一件。
訓練、保留、真人看,是三個不同的問題
訓練是拿你的內容去改模型的權重。保留是把你的內容存在某處一段時間,通常為了濫用偵測或除錯。真人看是有工程師或標註人員讀得到那些內容。
三者的關係是單向的:要訓練通常得先保留,但保留不等於會拿去訓練。把這條線分清楚,你才不會因為看到「保留 30 天」就以為自己的東西進了下一代模型,也才不會因為看到「不用於訓練」就以為沒人讀得到。
OpenAI 的官方資料頁把這條線寫得最直白:2023 年 3 月 1 日起,送進 OpenAI API 的資料不會被用來訓練或改進 OpenAI 的模型,除非你自己明確選擇分享。同一頁也寫著,濫用偵測日誌預設會對所有 API 用法產生,並保留最長 30 天。不訓練,但有保留。
Anthropic 那邊是同樣的兩層,只是多一個轉折。官方文件寫「保留的資料在未經你明確許可的情況下絕不會用於模型訓練」,而對話內容預設不保留——例外是被列為 Covered Models 的那幾顆(Claude Fable 5.1、Mythos 5.1、Fable 5、Mythos 5),它們要求 30 天保留,而且除非 Anthropic 明示授權,這幾顆在零資料保留(zero data retention)的組織底下根本叫不動,會回 400。挑模型的那一刻,你同時也在挑保留期。
三種形狀:標在價目表上、藏在免費裡、寫在預設值裡
第一種是明碼標價。 Meta 的 contributor 檔是現在最乾脆的例子——它誠實得刺眼:你知道自己在賣什麼、賣多少錢。
第二種是藏在「免費」裡。 Google 的 Gemini API 附加條款把免費層與付費層分開寫。免費層那邊:Google 會用你送出的內容與生成的回應「來提供、改進與開發 Google 的產品」,而且真人審閱者可以讀取、標註與處理你的 API 輸入與輸出。付費層那邊:Google 不會用你的提示詞或回應來改進產品,只為偵測與防止違規而留存有限時間。同一家公司、同一組 API,兩份條款。免費不是打折,是另一份合約。
第三種是寫在預設值裡。 OpenAI 與 Anthropic 的 API 預設都不拿去訓練,要訓練得你自己去打開那個開關。這一格最容易出事的地方不在條款,在於那個開關可能被團隊裡的另一個人打開,而帳單上看不出差別。
你自己查得到的七件事
- 這一格是預設開還是預設關,以及誰有權限打開它。
- 免費或便宜那一格的條款,是不是另一份。 讀了付費頁的隱私條款,別以為免費層適用同一套。
- 範圍到哪裡:只有提示詞與輸出,還是連上傳的檔案、工具回傳的結果、整個程式碼庫都算。
- 保留多久、為什麼留。 濫用偵測的保留期跟訓練授權是兩件事,要分開問。
- 有沒有真人讀得到。 條款裡出現 human reviewers 這類字眼,講的就是這件事。
- 關掉之後,已經進去的資料算什麼。 多數條款不承諾回溯處理。
- 你有沒有資格替別人決定。 客戶的程式碼、含個資的文件、簽過保密的專案——授權訓練這件事,你多半沒有那個權限。
兩條最容易漏掉的邊界
轉售平台上的條款不是同一份。 同一顆模型放在 Amazon Bedrock 或 Google Cloud 上賣,資料處理者是雲廠商而不是模型商——Anthropic 自己的文件就明寫這一點,要你去看雲平台那邊的等價控制。你簽的是誰的合約,決定這題的答案。
「零保留」也有例外。 Anthropic 的文件寫,即使在零資料保留或 HIPAA 安排底下,法律要求的情況、或被自動信任與安全系統標記的內容,仍可能被保留最長兩年。零保留是預設,不是保證。
這頁不做的事也先講明:不推薦任何一家的方案,也不做價格比較表。上面四家出現的原因是它們的條款寫得夠清楚、可以當標本,不是因為它們比較好。
便宜那一格的限速,就是它的用途說明書
回到 Meta 那張表。contributor 檔除了便宜,還有另一組數字:每分鐘 100 次請求,標準檔是 3,000 次,而且額度是整個團隊共用。同一顆模型,價錢差一個數量級,吞吐量差 30 倍。
我的讀法是:便宜那一格從設計上就不是給生產環境跑的,它要買的是一個人跟代理慢慢來回的完整過程——那正是訓練代理最值錢的資料。所以判斷這類方案,我不會只算單價省下多少,我會先看限速。限速比條款更誠實地說出了他們想買什麼。
這跟點數什麼時候會不見、月費看不出你其實花了多少是同一類問題的不同面向:帳單上的數字從來不是全部的成本。而你以為在挑模型,其實在挑合約這句話,在這張價目表上是照字面成立的。
如果要一條夠簡單、記得住的規則:能公開的東西用便宜那一格,不能公開的東西用貴的那一格。你多付的價差,就是「不能公開」這件事的標價。
查核備註:四家的條款細節取自各自的官方文件(Meta Model API 定價與速率限制頁、Google Gemini API 附加條款、OpenAI 資料控制指南、Anthropic API 資料保留文件),是我 2026 年 9 月 5 日讀到的版本。三個倍數與 30 倍吞吐量差距是我拿官方數字相除得出的。我沒有實測任何一家的實際保留或刪除行為,也沒有向任何一家求證條款的執行方式。OpenAI 另有一個「打開資料分享換取每日免費 token」的方案,我今天讀不到它的官方說明頁(回 403),所以本文不引用該方案的任何額度數字。本文不構成法律意見。
SOURCES
- AModel API — Pricing and rate limits(Meta 官方)
- AGemini API Additional Terms of Service(Google 官方)
- AYour data — OpenAI API Docs(OpenAI 官方)
- AAPI and data retention — Claude Docs(Anthropic 官方)
- AWhat's new in Claude Fable 5.1 — Claude Docs(Anthropic 官方)
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究,矽基前沿編輯部撰稿,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明


