
思考強度(effort)是什麼?沒設定的人,跑的是原廠那一檔
官方對有些模型建議的,不是那一檔
我今天把三家的官方文件並排讀了一遍,只想弄清楚一件事:那個叫 effort 的參數,我不設會怎樣。
最意外的一格在 Anthropic 的文件裡。同一頁上,Claude Sonnet 4.6 的預設值寫著 high,緊接著的建議是「medium(建議的預設值)」。同一頁再往上,Claude Opus 4.7 的預設值一樣是 high,建議卻是從 xhigh 起跳。一顆建議調低、一顆建議調高,兩顆的預設值是同一格。
意思是:這兩顆模型,你不動手,跑的都不是官方自己建議的檔位。
思考強度(effort) 是模型廠給的一個參數,決定模型回答一次請求時願意花掉多少 token。它調的不是模型大小,也不是換一顆比較笨的模型——同一顆模型,同一個提示詞,你只是告訴它願意投入多少工作量。而那些多出來的 token,進的是輸出那一格的帳單。Anthropic 叫它
effort,OpenAI 叫reasoning.effort,Google 叫thinking_level。
這件事的原理我們七月寫過——讓模型多想一會兒可以換到更好的答案。這頁講的是它變成一個你要選的旋鈕之後,怎麼選、帳單長什麼樣。
三家的名字不一樣,預設值也不一樣
Anthropic 的參數是 output_config.effort,五格:low、medium、high、xhigh、max。API 預設是 high,而且文件寫得很直白:把 effort 設成 high,跟完全不帶這個參數,行為完全一樣。
OpenAI 的參數是 reasoning.effort。官方寫「支援的值視模型而定,可能包含 none、minimal、low、medium、high、xhigh、max」——注意是「視模型而定」,不是一張共通的清單。GPT-5.5 預設 medium,GPT-5.6 系列在標準與 pro 兩種模式下也都是 medium。GPT-6 Astra 不吃 none,設了直接回 HTTP 400。
Google 的參數是 thinking_level,而它沒有一個全站預設值,是逐顆模型各自一格:Gemini 3.8 Flash、3.7 Flash、3.5 Flash 都是「On (medium)」,3.5 Flash Lite 是「On (minimal)」,2.5 Flash Lite 是「Off」。
同一個「我不設」的動作,在三家是三種結果:Anthropic 給你高檔,OpenAI 給你中間檔,Google 看你叫的是哪顆模型,其中一顆根本不想。
它花的是輸出那一格的錢
這是三家文件裡少數完全一致的地方,也是這個旋鈕跟帳單的接點。
Anthropic 寫 effort 影響回應裡的所有 token:文字與說明、工具呼叫與它的參數、以及思考。OpenAI 寫推理 token 以輸出 token 計費,它們佔用上下文視窗,但 API 看不到內容。Google 寫得最像一張帳單:回應的價格是輸出 token 加思考 token 的總和,而且是按模型實際產生的完整思考 token 計價——即使 API 只回給你摘要。
換句話說,你調的不是輸入那一格。輸入那一格是你送進去的東西,長度你自己看得到;輸出那一格是模型自己決定要花多少,而 effort 就是你對那個決定唯一的發言權。
骨頭:預設值不是官方建議值
回到開頭那兩顆。Anthropic 的文件對 Claude Sonnet 4.6 寫「Sonnet 4.6 預設 high effort」,然後叫你「明確設定 effort,以免遇到非預期的延遲」,建議值是 medium。對 Claude Opus 4.7 與 4.8 寫「編碼與代理用途從 xhigh 開始」,接著補一句「API 預設是 high。要用 xhigh 得明確設定。」
一顆的建議在預設值下面,一顆在上面。兩顆的預設值都是 high。
不是每顆都對不上。同一份文件對 Claude Fable 5.1、Opus 5 與 Sonnet 5 寫的是「從預設的 high 開始」——那三顆的預設值就是建議值。所以這件事沒有一個通則可以背,只有一個動作可以做:你用的那顆,逐顆去查。
同一份文件還有一句話值得單獨拉出來:如果你把 effort 設定從上一顆模型搬過來,官方要你在自己的評測上重跑一次 effort 掃描,不要沿用。這句話的意思是,這個參數的刻度不跨模型通用——medium 在兩顆模型上不是同一個東西。
調低會少做什麼
多數人以為調低 effort 就是「回答變短」。文件寫的不是這個。
Anthropic 列出低檔位的具體行為:把多個動作併成比較少次的工具呼叫、少叫工具、不先講計畫直接動手、做完只給簡短的確認訊息。高檔位反過來:多叫工具、先解釋計畫、給詳細的變更摘要。
我的讀法是,對代理流程來說這比「字變少」嚴重得多——少叫一次搜尋,少掉的是一份證據,不是幾個字。如果你的代理靠工具呼叫去核對事實,把它降到最低檔,等於同時把它的查證預算一起降了。這是我的讀法,官方文件只寫行為,沒有寫這個推論。
改這一格會不會打掉快取
會,而且這一格是最容易在帳單上反咬的。
Anthropic 寫明:頂層的 effort 值會影響整份請求的渲染結果,所以在請求之間改它,不保留先前輪次的快取前綴。文件給的建議也很硬——如果你靠提示快取撐一段長對話,而你的模型不支援逐訊息改 effort,那就在開場選一格、全程不要動。
支援逐訊息改的模型有一條專門的路:帶 beta header mid-conversation-output-config-2026-07-01,在 messages 裡插一則沒有內容的 system 訊息、只帶新的 effort,新檔位從下一個 user 輪次生效,前面的快取前綴照樣命中。目前寫在文件上的是 Claude Fable 5.1、Mythos 5.1 與 Opus 5;不支援的模型會回 400,錯誤訊息直說這顆模型不支援逐輪 effort。
五個你自己查得到的問題
- 這顆模型的預設是哪一檔,官方建議是哪一檔,兩者一不一樣。 兩個值都寫在同一頁上,但它們不會擺在一起,要自己對。
- 這一檔進的是輸入還是輸出那一格的帳。 三家的答案目前都是輸出。
- 改了會不會打掉快取,有沒有中途改的辦法。 沒有中途改的辦法,就開場選定不要動。
- 最低檔會不會連工具都懶得叫。 你的流程如果靠工具查證,這一題比省下來的錢重要。
- 高檔位有沒有配套的硬上限。 Anthropic 寫
max_tokens是「思考加回應文字」的總量硬上限,高檔位要把它調大,官方給的起手值是 64k——不調,高檔位會在半路被截斷。
它不保證什麼
它不是 token 預算。 官方寫得很清楚:effort 是行為訊號,不是嚴格的 token 上限。低檔位遇到夠難的題還是會想,只是想得比高檔位少。想用它當成本天花板的人,要的其實是 max_tokens 那個欄位。
它不保證回應變短。 Anthropic 對 Opus 5 明寫,改 effort 不會可靠地縮短看得到的回應長度,要短就在提示詞裡要求。
檔位不是每顆都齊。 官方一句話帶過但很實際:不是每個支援 max 的模型都支援 xhigh。
介面上通常看不到自己在哪一檔。 這一格我今天只在一個地方找到明確的官方答案:Anthropic 寫 Sonnet 5 在 Claude API 與 Claude Code 上都預設 high。其他產品的介面把哪一檔當預設,我沒有在官方頁面上查到——這也是為什麼月費看不出你實際花了多少這個問題會一直在。
我還沒查到答案的是差價。三家都沒有公布「同一題在 low 與 max 各燒多少 token」的官方數字,而那正是你做決定要用的那個數字。在有人公布之前,唯一的辦法是在自己的工作負載上各跑一次——這也正好是三家文件不約而同給的同一句建議。真要盯,就盯哪一家先把各檔位的 token 用量寫進文件;那一天到了,這個旋鈕才算真的可以拿來算帳。
查核備註:本篇是文件檢視,以我 2026-09-06 讀到的版本為準,我沒有實際呼叫任何一家的 API 去比較各檔位的 token 用量或成本。GPT-6 Astra 的預設檔位官方頁沒寫,所以本文沒有寫。Google 那頁我讀到的是各模型的預設檔位與計價方式,沒有讀到每顆模型可調的檔位完整清單。三家的價目數字本文一個都沒引用——這頁講的是這個參數怎麼運作,不是誰比較便宜。
SOURCES
- AEffort — Claude Docs(Anthropic 官方)
- AReasoning — OpenAI API Docs(OpenAI 官方)
- AThinking — Gemini API Docs(Google 官方)
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究,矽基前沿編輯部撰稿,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明


