Gemini 3.6 Flash 兩層折扣,只疊在輸出那一格
輸入價一毛沒動。
先把結果放前面:如果你拿一份跑在 Gemini 3.5 Flash 上的 AI 代理人(agent)任務,原封不動搬到 7 月 21 日上線的 Gemini 3.6 Flash,輸出那一側的成本大約會掉到原本的七成。
這七成是兩件事疊出來的。每百萬輸出 token 的官方牌價從 9 美元降到 7.50 美元,降幅 16.7%;Google 同時說,依 Artificial Analysis Index,新模型完成同樣的事少吐 17% 的輸出 token。折價券兩張,可惜只能用在同一張單據的下半截——輸入那一格還是 1.50 美元,跟前一代一模一樣。
所以「Gemini 3.6 Flash 比較便宜」這句話,對你成不成立、成立多少,取決於你的活長什麼樣子。
輸出價砍 16.7%,token 再少吐 17%
拆開來算比較清楚。這張表的前兩列是官方數字,第三列是我們把它們乘起來的結果:
| 項目 | 3.5 Flash | 3.6 Flash | 變化 |
|---|---|---|---|
| 每百萬輸出 token 牌價 | $9.00 | $7.50 | −16.7% |
| 完成同一件事的輸出 token 用量 | 基準 | 少 17%(Google 稱,依 Artificial Analysis Index) | −17% |
| 疊乘後的輸出側成本 | 100% | 約 69% | −31% |
| 每百萬輸入 token 牌價 | $1.50 | $1.50 | 沒動 |
0.833 × 0.83 ≈ 0.69。這個推導只在輸出側成立,而且第二列是 Google 自己引用的指數結果,不是我們實測。Google 的說法是新模型「用更少的推理步驟與工具呼叫完成多步驟流程」——會思考的模型把思考本身也計成輸出 token,所以少繞幾圈,帳單就直接少一截。
Batch 模式同步跟著調:3.6 Flash 是輸入 0.75 美元、輸出 3.75 美元,3.5 Flash 則是 0.75 美元與 4.50 美元。快取價兩者都是 0.15 美元,外加每小時 1 美元的儲存費。
你的輸入輸出比,決定這三成有沒有感
這裡是最容易誤讀的地方。輸出側降三成,不等於帳單降三成。
長輸入、短輸出的用法——把一疊文件塞進百萬 token 的脈絡窗口,只要一段摘要或一個分類標籤——成本大頭本來就在輸入那格,這次幾乎沒被碰到。反過來,代理人迴圈是輸出重度使用者:每一輪的思考、每一次工具呼叫的參數、每一段改寫的程式碼,全部計在輸出。同樣是換模型,後者才會在月結帳單上看得出來。
想知道自己屬於哪一種,不用猜。翻上個月的 API 用量報表,把輸入 token 與輸出 token 的花費各自加總,看輸出佔比多少,再乘上 0.31。這是這次唯一需要你自己動手的計算。
Flash 家族現在的完整牌價長這樣,方便你順手比對自己現在跑在哪一格:
| 模型 | 輸入 / 百萬 token | 輸出 / 百萬 token |
|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 |
| Gemini 3.5 Flash | $1.50 | $9.00 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 |
| Gemini 3.1 Flash-Lite | $0.25(文字/圖/影片) | $1.50 |
同一天上線的 3.5 Flash-Lite 是另一條路:每秒 350 個輸出 token,官方擺明衝著代理人迴圈來。要注意版號沒對齊——這批發的是 3.6 Flash 配 3.5 Flash-Lite,切模型時 model ID 得看清楚,新的那顆是 gemini-3.6-flash。
知識截止從 2025 年 1 月跳到 2026 年 3 月
對寫程式的人來說,這行可能比省下的三成更實際。
前一代 3.5 Flash 的知識截止停在 2025 年 1 月;3.6 Flash 的 model card 寫的是 2026 年 3 月。中間這 14 個月,是模型不知道你正在用的框架已經改過幾次 API 的期間。少一點「它很有自信地寫出兩年前的寫法」,比基準分數多幾個百分點更省你的時間。
其餘規格沒變:輸入脈絡窗口 1,048,576 個 token、輸出上限 65,536 個,支援思考、函式呼叫、結構化輸出、程式碼執行、快取、搜尋接地,電腦操作仍是預覽;Live API 與圖像、音訊生成則不支援。Google 自測的基準是 DeepSWE 49%(前代 37%)、MLE Bench 63.9%(49.7%)、OSWorld-Verified 83%(78.4%)。
model card 的六個欄位,全部指回上一代
真正有意思的一行,藏在 model card 而不是公告裡。
那份文件開宗明義寫著「Gemini 3.6 Flash is based on Gemini 3.5 Flash」,接著在模型相依、架構、訓練資料集、訓練資料處理、硬體、軟體六個欄位,一律請讀者去看 Gemini 3.5 Flash 的 model card。整份卡片自己填的內容,集中在評測、已知限制、安全結果——也就是後訓練之後才量得出來的那些東西。
同一天,Google 在公告裡放了另一句話:Gemini 4「我們至今最有企圖心的預訓練跑起來了」,沒有時程。兩句並排看,這次上線的工作馬模型往前推的是效率,前沿的算力預算擺在下一代旗艦身上。對照先前 3.5 Pro 卡在寫程式這一關、遲到兩個月,Google 這個月給開發者最有感的東西是省,不是強。
安全評估也一併公布,同樣是 Google 自測:對比 3.5 Flash,文字對文字安全改善 1.35 個百分點、多語安全改善 5.45 個百分點,非必要拒答多了 0.25 個百分點,語氣項目退了 3.31 個百分點——退步是 Google 自己標出來的,它說不影響整體安全。
同一天發的 Flash Cyber,你拿不到
三款模型裡最搶眼的那顆,一般開發者碰不到。
Gemini 3.5 Flash Cyber 是建在 3.5 Flash 上、專門微調來找出、驗證與修補漏洞的模型,只透過 CodeMender 開放給政府與信任夥伴的限量試辦。Google 給的數字是在 V8 JavaScript 引擎測試中找出 55 個確認問題,對照 3.5 Flash 的 47 個與 Opus 4.6 的 36 個;另外舉了一個例子:兩小時內在公開 API 找到遠端執行漏洞,並在一個敏感的生產服務裡找到記憶體毀損漏洞。這些全是 Google 自測,目前沒有第三方複驗,而且短期內也沒有人能自己驗——拿不到模型。
這些數字,哪些該打折看?
三件事要誠實講。
第一,「少 17% 輸出 token」是 Google 引用 Artificial Analysis Index 的結果,基準組合由它挑,你的實際負載未必複製得出來——照著上一段的方法算完之後,先跑一週真實流量再下結論。第二,model card 把六個欄位指回前一代,只能讀成官方文件這樣寫,推不出 Google 的預訓練配置;有人會說那只是文件寫法的慣例,這個反對意見成立。第三,DeepSWE 與 MLE Bench 那組數字同樣是 Google 自測。
該做的事只有一件:翻出上個月的用量報表,看輸出佔比。輸出佔比高的人,這個月換過去就是三成;輸出佔比低的人,這次的公告跟你其實沒什麼關係。
SOURCES
- A Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber(Google)
- A Gemini 3.6 Flash Model Card(Google DeepMind)
- A Gemini API Pricing(Google AI for Developers)
- A Gemini 3.6 Flash(Gemini API 官方模型文件)
- A Introducing Gemini 3.5 Flash Cyber(Google DeepMind)
- B Google launches Gemini 3.6 Flash and 3.5 Flash-Lite, teases Gemini 4(9to5Google)
- B Google Launches Gemini 3.5 Flash Cyber AI to Find and Fix Software Vulnerabilities(The Hacker News)
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明