資訊圖:暖色紙底,左上標題「思考強度 effort」。中央一條橫向五格檔位刻度條,格內由左至右寫 low、medium、high、xhigh、max。刻度條上方一枚灰色指針標籤寫「預設」,尖端指向中央的 high 格;刻度條下方一枚藍色指針標籤寫「官方建議」,分出兩條藍色箭頭分別指向 medium 與 xhigh 兩格,這兩格以藍色描邊。畫面底部橫帶小字寫「多花的 token 算在輸出那一格」。
大百科

思考強度(effort)是什麼?沒設定的人,跑的是原廠那一檔

官方對有些模型建議的,不是那一檔

我今天把三家的官方文件並排讀了一遍,只想弄清楚一件事:那個叫 effort 的參數,我不設會怎樣。

最意外的一格在 Anthropic 的文件裡。同一頁上,Claude Sonnet 4.6 的預設值寫著 high,緊接著的建議是「medium(建議的預設值)」。同一頁再往上,Claude Opus 4.7 的預設值一樣是 high,建議卻是從 xhigh 起跳。一顆建議調低、一顆建議調高,兩顆的預設值是同一格。

意思是:這兩顆模型,你不動手,跑的都不是官方自己建議的檔位。

思考強度(effort) 是模型廠給的一個參數,決定模型回答一次請求時願意花掉多少 token。它調的不是模型大小,也不是換一顆比較笨的模型——同一顆模型,同一個提示詞,你只是告訴它願意投入多少工作量。而那些多出來的 token,進的是輸出那一格的帳單。Anthropic 叫它 effort,OpenAI 叫 reasoning.effort,Google 叫 thinking_level

這件事的原理我們七月寫過——讓模型多想一會兒可以換到更好的答案。這頁講的是它變成一個你要選的旋鈕之後,怎麼選、帳單長什麼樣。

三家的名字不一樣,預設值也不一樣

Anthropic 的參數是 output_config.effort,五格:lowmediumhighxhighmax。API 預設是 high,而且文件寫得很直白:把 effort 設成 high,跟完全不帶這個參數,行為完全一樣。

OpenAI 的參數是 reasoning.effort。官方寫「支援的值視模型而定,可能包含 noneminimallowmediumhighxhighmax」——注意是「視模型而定」,不是一張共通的清單。GPT-5.5 預設 medium,GPT-5.6 系列在標準與 pro 兩種模式下也都是 medium。GPT-6 Astra 不吃 none,設了直接回 HTTP 400。

Google 的參數是 thinking_level,而它沒有一個全站預設值,是逐顆模型各自一格:Gemini 3.8 Flash、3.7 Flash、3.5 Flash 都是「On (medium)」,3.5 Flash Lite 是「On (minimal)」,2.5 Flash Lite 是「Off」。

同一個「我不設」的動作,在三家是三種結果:Anthropic 給你高檔,OpenAI 給你中間檔,Google 看你叫的是哪顆模型,其中一顆根本不想。

它花的是輸出那一格的錢

這是三家文件裡少數完全一致的地方,也是這個旋鈕跟帳單的接點。

Anthropic 寫 effort 影響回應裡的所有 token:文字與說明、工具呼叫與它的參數、以及思考。OpenAI 寫推理 token 以輸出 token 計費,它們佔用上下文視窗,但 API 看不到內容。Google 寫得最像一張帳單:回應的價格是輸出 token 加思考 token 的總和,而且是按模型實際產生的完整思考 token 計價——即使 API 只回給你摘要。

換句話說,你調的不是輸入那一格。輸入那一格是你送進去的東西,長度你自己看得到;輸出那一格是模型自己決定要花多少,而 effort 就是你對那個決定唯一的發言權。

骨頭:預設值不是官方建議值

回到開頭那兩顆。Anthropic 的文件對 Claude Sonnet 4.6 寫「Sonnet 4.6 預設 high effort」,然後叫你「明確設定 effort,以免遇到非預期的延遲」,建議值是 medium。對 Claude Opus 4.7 與 4.8 寫「編碼與代理用途從 xhigh 開始」,接著補一句「API 預設是 high。要用 xhigh 得明確設定。」

一顆的建議在預設值下面,一顆在上面。兩顆的預設值都是 high

不是每顆都對不上。同一份文件對 Claude Fable 5.1、Opus 5 與 Sonnet 5 寫的是「從預設的 high 開始」——那三顆的預設值就是建議值。所以這件事沒有一個通則可以背,只有一個動作可以做:你用的那顆,逐顆去查

同一份文件還有一句話值得單獨拉出來:如果你把 effort 設定從上一顆模型搬過來,官方要你在自己的評測上重跑一次 effort 掃描,不要沿用。這句話的意思是,這個參數的刻度不跨模型通用——medium 在兩顆模型上不是同一個東西。

調低會少做什麼

多數人以為調低 effort 就是「回答變短」。文件寫的不是這個。

Anthropic 列出低檔位的具體行為:把多個動作併成比較少次的工具呼叫、少叫工具、不先講計畫直接動手、做完只給簡短的確認訊息。高檔位反過來:多叫工具、先解釋計畫、給詳細的變更摘要。

我的讀法是,對代理流程來說這比「字變少」嚴重得多——少叫一次搜尋,少掉的是一份證據,不是幾個字。如果你的代理靠工具呼叫去核對事實,把它降到最低檔,等於同時把它的查證預算一起降了。這是我的讀法,官方文件只寫行為,沒有寫這個推論。

改這一格會不會打掉快取

會,而且這一格是最容易在帳單上反咬的。

Anthropic 寫明:頂層的 effort 值會影響整份請求的渲染結果,所以在請求之間改它,不保留先前輪次的快取前綴。文件給的建議也很硬——如果你靠提示快取撐一段長對話,而你的模型不支援逐訊息改 effort,那就在開場選一格、全程不要動。

支援逐訊息改的模型有一條專門的路:帶 beta header mid-conversation-output-config-2026-07-01,在 messages 裡插一則沒有內容的 system 訊息、只帶新的 effort,新檔位從下一個 user 輪次生效,前面的快取前綴照樣命中。目前寫在文件上的是 Claude Fable 5.1、Mythos 5.1 與 Opus 5;不支援的模型會回 400,錯誤訊息直說這顆模型不支援逐輪 effort。

五個你自己查得到的問題

  1. 這顆模型的預設是哪一檔,官方建議是哪一檔,兩者一不一樣。 兩個值都寫在同一頁上,但它們不會擺在一起,要自己對。
  2. 這一檔進的是輸入還是輸出那一格的帳。 三家的答案目前都是輸出。
  3. 改了會不會打掉快取,有沒有中途改的辦法。 沒有中途改的辦法,就開場選定不要動。
  4. 最低檔會不會連工具都懶得叫。 你的流程如果靠工具查證,這一題比省下來的錢重要。
  5. 高檔位有沒有配套的硬上限。 Anthropic 寫 max_tokens 是「思考加回應文字」的總量硬上限,高檔位要把它調大,官方給的起手值是 64k——不調,高檔位會在半路被截斷。

它不保證什麼

它不是 token 預算。 官方寫得很清楚:effort 是行為訊號,不是嚴格的 token 上限。低檔位遇到夠難的題還是會想,只是想得比高檔位少。想用它當成本天花板的人,要的其實是 max_tokens 那個欄位。

它不保證回應變短。 Anthropic 對 Opus 5 明寫,改 effort 不會可靠地縮短看得到的回應長度,要短就在提示詞裡要求。

檔位不是每顆都齊。 官方一句話帶過但很實際:不是每個支援 max 的模型都支援 xhigh

介面上通常看不到自己在哪一檔。 這一格我今天只在一個地方找到明確的官方答案:Anthropic 寫 Sonnet 5 在 Claude API 與 Claude Code 上都預設 high。其他產品的介面把哪一檔當預設,我沒有在官方頁面上查到——這也是為什麼月費看不出你實際花了多少這個問題會一直在。

我還沒查到答案的是差價。三家都沒有公布「同一題在 lowmax 各燒多少 token」的官方數字,而那正是你做決定要用的那個數字。在有人公布之前,唯一的辦法是在自己的工作負載上各跑一次——這也正好是三家文件不約而同給的同一句建議。真要盯,就盯哪一家先把各檔位的 token 用量寫進文件;那一天到了,這個旋鈕才算真的可以拿來算帳。

查核備註:本篇是文件檢視,以我 2026-09-06 讀到的版本為準,我沒有實際呼叫任何一家的 API 去比較各檔位的 token 用量或成本。GPT-6 Astra 的預設檔位官方頁沒寫,所以本文沒有寫。Google 那頁我讀到的是各模型的預設檔位與計價方式,沒有讀到每顆模型可調的檔位完整清單。三家的價目數字本文一個都沒引用——這頁講的是這個參數怎麼運作,不是誰比較便宜。

SOURCES

  1. AEffort — Claude Docs(Anthropic 官方)
  2. AReasoning — OpenAI API Docs(OpenAI 官方)
  3. AThinking — Gemini API Docs(Google 官方)

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

本文由 AI 協助研究,矽基前沿編輯部撰稿,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

WEEKLY [SI]GNALS

訂閱《矽基前沿週報》

每週五早上,把本週 AI 與算力產業最值得記住的變化連回台灣。

本週關鍵訊號 · 為什麼值得記住 · 下週觀察 · 5 分鐘讀完。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
大百科
Key claims
  • 思考強度(effort)是模型廠提供的參數,決定同一顆模型回答一次請求時願意花掉多少 token,調的不是模型大小;Anthropic 稱 effort、OpenAI 稱 reasoning.effort、Google 稱 thinking_level。
  • Anthropic 官方文件列出五個 effort 檔位(low、medium、high、xhigh、max),API 預設為 high,並寫明將 effort 設為 high 與完全不帶該參數的行為完全相同。
  • OpenAI 官方推理指南寫明支援值視模型而定,可能包含 none、minimal、low、medium、high、xhigh、max;GPT-5.5 與 GPT-5.6 系列預設為 medium,GPT-6 Astra 不支援 none,設定後回 HTTP 400。
  • Google 官方文件的 thinking_level 沒有全站預設值,而是逐模型設定:Gemini 3.8 Flash、3.7 Flash、3.5 Flash 預設為 On (medium),3.5 Flash Lite 為 On (minimal),2.5 Flash Lite 為 Off。
  • 三家官方文件一致把思考/推理所花的 token 計入輸出那一格:Anthropic 寫 effort 影響回應中的所有 token,OpenAI 寫推理 token 以輸出 token 計費,Google 寫回應價格是輸出 token 與思考 token 的總和。
  • Anthropic 官方文件對 Claude Sonnet 4.6 寫明預設為 high 卻建議使用 medium,對 Claude Opus 4.7 與 4.8 寫明 API 預設為 high 卻建議編碼與代理工作從 xhigh 起跳——建議值與預設值不一致且方向相反;對 Fable 5.1、Opus 5、Sonnet 5 則寫明從預設的 high 開始。
  • Anthropic 官方文件寫明變更頂層 effort 值不保留先前輪次的提示快取前綴;逐訊息變更 effort 需 beta header mid-conversation-output-config-2026-07-01,目前列出支援的是 Claude Fable 5.1、Mythos 5.1 與 Opus 5,不支援的模型回 400。
  • Anthropic 官方文件寫明 effort 是行為訊號而非嚴格的 token 預算,低檔位遇到夠難的問題仍會思考;低檔位的具體行為包含合併並減少工具呼叫、不先說明計畫直接動作。
Entities
Claude Fable 5.1 · Claude Opus 5 · Claude Sonnet 4.6 · GPT-6 Astra · Gemini 3.8 Flash · reasoning effort · thinking level
Taiwan relevance
medium
Confidence
high
Last updated
2026-09-06
Canonical URL
https://signals.tw/articles/what-is-effort-thinking-level/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · 大百科線(編輯:廖玄同),《思考強度(effort)是什麼?沒設定的人,跑的是原廠那一檔》,矽基前沿 [Si]gnals,2026-09-06。https://signals.tw/articles/what-is-effort-thinking-level/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.