AI 重寫了 SQLite,帳單差 7.9 倍
同樣跑到 100%,為什麼有人多付 9 千美元?
411 美元,跟 9,373 美元。
這是同一個任務、同樣跑到測試全綠的兩張帳單裡,「負責幹活」那一段的花費。Cursor 在 2026 年 7 月 20 日公布了一份 agent swarm(代理人群集)實驗報告,讓一群 AI 代理人只拿著 835 頁的 SQLite 手冊,用 Rust 從零寫出一個資料庫。同一件事跑了好幾遍,每遍換一組模型,最後成品品質 相近,總成本卻從 1,339 美元一路拉到 10,565 美元。
差距不在誰比較會寫程式。差距在你把最貴的那顆模型,放在哪個位置。
一群代理人只拿到 835 頁手冊,交出一個能跑的資料庫
實驗設定是刻意刁難的。Cursor 把 SQLite 的原始碼、測試套件、編譯好的執行檔全部拿走,也切斷 網路,代理人手上只有那本手冊。
驗收用的是 sqllogictest——SQLite 專案自己的測試套件,裡面有數百萬條已知正解的查詢。報告寫 得很直接:這套測試從頭到尾沒告訴過 swarm 它存在。每一輪跑完,Cursor 還人工翻過程式碼和執行 過程,確認沒有作弊、沒有抄捷徑。
新版架構下的每一種模型組合,最後都跑到 100%。
帳單拆開,錢不是花在寫程式那一端
報告裡最有意思的一段,是 Cursor 把成本按角色拆開。
在 GPT-5.5 同時當規劃者和工人的那一跑,光是工人端就吃掉 9,373 美元,佔總價 10,565 美元的 大部分。而在 Opus 4.8 負責規劃、Composer 2.5 負責執行的那一跑,整個工人艦隊加起來 411 美元。
用原文的兩個數字相減,本刊得到那一跑的規劃端約 928 美元:1,339 美元的總帳裡,近七成付給了 那顆從頭到尾沒寫過一行程式的模型。Cursor 自己的描述對得上:擔任規劃者的 Opus 「只產出一小部分 token 卻佔約三分之二成本」,擔任工人的 Composer「產出絕大多數 token,只 佔其餘三分之一」。
前沿模型不是拿來幹活的,是拿來把活講清楚的。
四種組合並排:同樣 100%,總價從 1,339 到 10,565 美元
Cursor 只公布了兩種組合的完整成本,其餘跑法它明說「只做了非正式評分,因此不對品質下結論」。 本刊照原文列出,沒有的欄位就留空,不補推估:
| 模型組合(規劃者/工人) | 總成本 | 四小時通過率(舊架構 → 新架構) | 最終引擎行數 |
|---|---|---|---|
| Opus 4.8 / Composer 2.5 | 1,339 美元 | 97% → 100% | 19,013 → 4,645 行 |
| GPT-5.5 / GPT-5.5 | 10,565 美元 | 約 77% → 約 85% | 原文未列 |
| Fable 5 / Composer 2.5 | 原文未列 | 約 73% → 約 73–75% | 64,305 → 9,908 行 |
| Grok 4.5 / Grok 4.5 | 原文未列 | 11%(不到兩小時被迫中止)→ 80% | 原文未列 |
10,565 除以 1,339,約 7.9 倍——這個除法是本刊做的,原文沒有直接寫出倍數。
這裡要順手擋一個誤傳:英文圈的 AI 電子報轉述時寫成「Fable 5 跑法花了 20,057 美元、價差 15 倍」,中文轉載也跟著抄。本刊三次抓取 Cursor 原文、逐句檢索所有帶金額的句子,原文裡沒有 20,057 這個數字,出現過的最高金額就是 10,565 美元。要引用這份報告的價差,用 7.9 倍。
順帶一提行數那一欄:Opus 組合從 19,013 行降到 4,645 行,分數還從 97% 升到 100%。少寫四分之三 的程式碼,跑得更好。
規劃者不寫程式,工人不做決定
架構本身只有一句話:規劃者用最聰明的模型,把目標拆成一棵一棵子任務再分派下去,永遠不自己 動手實作;工人用比較快、比較便宜的模型,只管執行,不做設計決定。
Cursor 給的理由不是「平行化」,是 context 效率:規劃者不實作,它的 context 就不會被低階細節 塞滿;工人不規劃,它就能把整個 context 花在一塊很窄的工作上。
舊架構失控的樣子,報告也留了紀錄。Grok 4.5 那一跑在舊系統下前兩小時產生 68,000 個 commit、 全程超過 70,000 次 merge 衝突,最熱門的那個檔案被 1,173 個不同代理人動過、衝突 7,771 次, 專案長到 54 個 crate、裡面有三套各自為政的 SQL 套件——最後撐不到兩小時就被人工中止。
換成新架構,同樣是 Grok 4.5:前兩小時約 970 個 commit,四小時全程衝突不到 1,000 次,最競爭 的檔案 47 次衝突,crate 數早早收斂在 9 個沒再長。分數從 11% 變成 80%。
支撐這個吞吐的是 Cursor 換掉的版本控制底層。他們今年稍早那套跑瀏覽器的 swarm 在 Git 上尖峰 大約每小時 1,000 個 commit,新系統的尖峰是每秒 1,000 個。
出這份數據的公司,剛好在賣執行端那顆模型
該講的都得講清楚。Composer 2.5 是 Cursor 自家的模型,而這場實驗裡最便宜的組合,工人位置放的 正是 Composer。「便宜模型足以執行」這個結論,對一家賣執行端模型的公司特別有利。Cursor 的 開發商 Anysphere 也已在 2026 年 6 月 16 日與 SpaceX 簽下約 600 億美元的全股票併購協議,預計 第三季完成、還等監理核准;受測模型裡的 Grok 4.5 就出自同一個體系。
Hacker News 上 206 分、92 則討論裡的質疑同樣站得住:SQLite 的原始碼本來就在訓練資料裡, 代理人做的可能比較接近轉寫而不是重建;每秒 1,000 個 commit 究竟是產能還是空轉;能被信任自主 工作的模型,算下來仍比請一個人貴。Cursor 自己也承認,原本想拿 GPT-5.6 Sol 當前沿配置,但它 對字面和強調語氣特別敏感,跑出其他模型沒有的失控迴圈,只好退回 GPT-5.5。
這些都沒有被反駁。但它們動搖的是「AI 重寫了資料庫」這個奇觀,動搖不了成本那一欄——因為成本 比較是在同一套架構、同一個任務裡做的,換的只有模型。
Cursor 給的結論句是這樣寫的:一個大任務裡真正需要前沿智慧的時刻很少,大概只有最初的拆解、 設計決定,還有某些取捨;一旦前沿的規劃者把模糊性收成一份明確到位的指令,剩下的,便宜模型 照著做就好。
你今天可以在自己的專案裡動的,就是這一格設定:把最貴的模型留在拆任務、定介面、做取捨的位置, 執行交給便宜的。至於 SQLite 那道題到底是重建還是回憶,Cursor 沒有做排除訓練資料的對照實驗, 這一格還空著。
LEARN
想系統性學會,不只看這一則?
Claude Code 教學:用終端 AI Agent 完成真正的工作
讓 Claude Code 在你的專案裡完成一個真實任務,而且控得住權限、驗得了 diff、管得住成本。
從第 0 課開始 →SOURCES
- A Agent swarms and the new model economics
- C Agent swarms and the new model economics | Hacker News
- B SpaceX formalizes $60 billion all-stock merger to acquire Cursor
- B SpaceX Buys Cursor In Largest Startup Acquisition Ever At $60 Billion
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明