矽基前沿 [Si]gnals
一張編輯概念圖:左側是單一個標著 PLANNER、$928 的大型指揮台,右側是成排標著 WORKER、$411 的密集小型終端機,中間一條流向線把規劃連到執行
工作現場

AI 重寫了 SQLite,帳單差 7.9 倍

同樣跑到 100%,為什麼有人多付 9 千美元?

411 美元,跟 9,373 美元。

這是同一個任務、同樣跑到測試全綠的兩張帳單裡,「負責幹活」那一段的花費。Cursor 在 2026 年 7 月 20 日公布了一份 agent swarm(代理人群集)實驗報告,讓一群 AI 代理人只拿著 835 頁的 SQLite 手冊,用 Rust 從零寫出一個資料庫。同一件事跑了好幾遍,每遍換一組模型,最後成品品質 相近,總成本卻從 1,339 美元一路拉到 10,565 美元。

差距不在誰比較會寫程式。差距在你把最貴的那顆模型,放在哪個位置。

一群代理人只拿到 835 頁手冊,交出一個能跑的資料庫

實驗設定是刻意刁難的。Cursor 把 SQLite 的原始碼、測試套件、編譯好的執行檔全部拿走,也切斷 網路,代理人手上只有那本手冊。

驗收用的是 sqllogictest——SQLite 專案自己的測試套件,裡面有數百萬條已知正解的查詢。報告寫 得很直接:這套測試從頭到尾沒告訴過 swarm 它存在。每一輪跑完,Cursor 還人工翻過程式碼和執行 過程,確認沒有作弊、沒有抄捷徑。

新版架構下的每一種模型組合,最後都跑到 100%。

帳單拆開,錢不是花在寫程式那一端

報告裡最有意思的一段,是 Cursor 把成本按角色拆開。

在 GPT-5.5 同時當規劃者和工人的那一跑,光是工人端就吃掉 9,373 美元,佔總價 10,565 美元的 大部分。而在 Opus 4.8 負責規劃、Composer 2.5 負責執行的那一跑,整個工人艦隊加起來 411 美元。

用原文的兩個數字相減,本刊得到那一跑的規劃端約 928 美元:1,339 美元的總帳裡,近七成付給了 那顆從頭到尾沒寫過一行程式的模型。Cursor 自己的描述對得上:擔任規劃者的 Opus 「只產出一小部分 token 卻佔約三分之二成本」,擔任工人的 Composer「產出絕大多數 token,只 佔其餘三分之一」。

前沿模型不是拿來幹活的,是拿來把活講清楚的。

四種組合並排:同樣 100%,總價從 1,339 到 10,565 美元

Cursor 只公布了兩種組合的完整成本,其餘跑法它明說「只做了非正式評分,因此不對品質下結論」。 本刊照原文列出,沒有的欄位就留空,不補推估:

模型組合(規劃者/工人)總成本四小時通過率(舊架構 → 新架構)最終引擎行數
Opus 4.8 / Composer 2.51,339 美元97% → 100%19,013 → 4,645 行
GPT-5.5 / GPT-5.510,565 美元約 77% → 約 85%原文未列
Fable 5 / Composer 2.5原文未列約 73% → 約 73–75%64,305 → 9,908 行
Grok 4.5 / Grok 4.5原文未列11%(不到兩小時被迫中止)→ 80%原文未列

10,565 除以 1,339,約 7.9 倍——這個除法是本刊做的,原文沒有直接寫出倍數。

這裡要順手擋一個誤傳:英文圈的 AI 電子報轉述時寫成「Fable 5 跑法花了 20,057 美元、價差 15 倍」,中文轉載也跟著抄。本刊三次抓取 Cursor 原文、逐句檢索所有帶金額的句子,原文裡沒有 20,057 這個數字,出現過的最高金額就是 10,565 美元。要引用這份報告的價差,用 7.9 倍。

順帶一提行數那一欄:Opus 組合從 19,013 行降到 4,645 行,分數還從 97% 升到 100%。少寫四分之三 的程式碼,跑得更好。

規劃者不寫程式,工人不做決定

架構本身只有一句話:規劃者用最聰明的模型,把目標拆成一棵一棵子任務再分派下去,永遠不自己 動手實作;工人用比較快、比較便宜的模型,只管執行,不做設計決定。

Cursor 給的理由不是「平行化」,是 context 效率:規劃者不實作,它的 context 就不會被低階細節 塞滿;工人不規劃,它就能把整個 context 花在一塊很窄的工作上。

舊架構失控的樣子,報告也留了紀錄。Grok 4.5 那一跑在舊系統下前兩小時產生 68,000 個 commit、 全程超過 70,000 次 merge 衝突,最熱門的那個檔案被 1,173 個不同代理人動過、衝突 7,771 次, 專案長到 54 個 crate、裡面有三套各自為政的 SQL 套件——最後撐不到兩小時就被人工中止。

換成新架構,同樣是 Grok 4.5:前兩小時約 970 個 commit,四小時全程衝突不到 1,000 次,最競爭 的檔案 47 次衝突,crate 數早早收斂在 9 個沒再長。分數從 11% 變成 80%。

支撐這個吞吐的是 Cursor 換掉的版本控制底層。他們今年稍早那套跑瀏覽器的 swarm 在 Git 上尖峰 大約每小時 1,000 個 commit,新系統的尖峰是每秒 1,000 個。

出這份數據的公司,剛好在賣執行端那顆模型

該講的都得講清楚。Composer 2.5 是 Cursor 自家的模型,而這場實驗裡最便宜的組合,工人位置放的 正是 Composer。「便宜模型足以執行」這個結論,對一家賣執行端模型的公司特別有利。Cursor 的 開發商 Anysphere 也已在 2026 年 6 月 16 日與 SpaceX 簽下約 600 億美元的全股票併購協議,預計 第三季完成、還等監理核准;受測模型裡的 Grok 4.5 就出自同一個體系。

Hacker News 上 206 分、92 則討論裡的質疑同樣站得住:SQLite 的原始碼本來就在訓練資料裡, 代理人做的可能比較接近轉寫而不是重建;每秒 1,000 個 commit 究竟是產能還是空轉;能被信任自主 工作的模型,算下來仍比請一個人貴。Cursor 自己也承認,原本想拿 GPT-5.6 Sol 當前沿配置,但它 對字面和強調語氣特別敏感,跑出其他模型沒有的失控迴圈,只好退回 GPT-5.5。

這些都沒有被反駁。但它們動搖的是「AI 重寫了資料庫」這個奇觀,動搖不了成本那一欄——因為成本 比較是在同一套架構、同一個任務裡做的,換的只有模型。


Cursor 給的結論句是這樣寫的:一個大任務裡真正需要前沿智慧的時刻很少,大概只有最初的拆解、 設計決定,還有某些取捨;一旦前沿的規劃者把模糊性收成一份明確到位的指令,剩下的,便宜模型 照著做就好。

你今天可以在自己的專案裡動的,就是這一格設定:把最貴的模型留在拆任務、定介面、做取捨的位置, 執行交給便宜的。至於 SQLite 那道題到底是重建還是回憶,Cursor 沒有做排除訓練資料的對照實驗, 這一格還空著。

LEARN

想系統性學會,不只看這一則?

Claude Code 教學:用終端 AI Agent 完成真正的工作

讓 Claude Code 在你的專案裡完成一個真實任務,而且控得住權限、驗得了 diff、管得住成本。

從第 0 課開始 →

SOURCES

  1. A Agent swarms and the new model economics
  2. C Agent swarms and the new model economics | Hacker News
  3. B SpaceX formalizes $60 billion all-stock merger to acquire Cursor
  4. B SpaceX Buys Cursor In Largest Startup Acquisition Ever At $60 Billion

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

WEEKLY [SI]GNALS

訂閱《矽基前沿週報》

每週五早上,把本週 AI 與算力產業最值得記住的變化連回台灣。

本週關鍵訊號 · 為什麼值得記住 · 下週觀察 · 5 分鐘讀完。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
工作現場
Key claims
  • Cursor 於 2026 年 7 月 20 日發表 agent swarm 實驗報告,任務是只給 835 頁的 SQLite 手冊、用 Rust 重寫一個資料庫,並刻意抽走 SQLite 原始碼、測試套件、SQLite 執行檔與網路連線。
  • 驗收使用 held-out 的 sqllogictest(SQLite 專案自己的測試套件,內含數百萬條已知正解的查詢),Cursor 載明從未告訴 swarm 這套測試存在,且每次跑完人工檢查有無作弊與抄捷徑。
  • Cursor 原文載明,各模型組合品質相近但成本差距極大,從 Opus 4.8 混合組合的 1,339 美元到單用 GPT-5.5 的 10,565 美元。
  • 在 GPT-5.5 同時擔任規劃者與工人的那一跑,工人端單獨花費 9,373 美元;在 Opus 4.8 規劃、Composer 2.5 執行的那一跑,整個工人艦隊只花 411 美元。
  • Cursor 表示在 Opus 4.8 與 Composer 2.5 的組合中,擔任規劃者的 Opus 只產出一小部分 token 卻佔約三分之二成本,擔任工人的 Composer 產出絕大多數 token 只佔其餘三分之一。
  • Cursor 的架構是規劃者與工人分層:規劃者用最聰明的模型、只拆解目標並分派而永不自己實作,工人用較快較便宜的模型、只執行而不規劃。
  • Cursor 自陳原本想用 GPT-5.6 Sol 當前沿配置,但該模型較容易受字面與強調語氣影響、出現其他受測模型沒有的失控迴圈,因此退回 GPT-5.5。
  • 聚合器流傳的「Fable 5 跑法花費 20,057 美元、價差 15 倍」在 Cursor 原文中不存在;原文出現的最高金額為 10,565 美元。
  • Cursor 開發商 Anysphere 於 2026 年 6 月 16 日與 SpaceX 簽署約 600 億美元全股票併購協議,預計 2026 年第三季完成、尚待監理核准。
Entities
Cursor · Anysphere · Composer 2.5 · Claude Opus 4.8 · GPT-5.5 · Grok 4.5 · SQLite · SpaceX
Taiwan relevance
medium
Confidence
high
Last updated
2026-07-21
Canonical URL
https://signals.tw/articles/cursor-swarm-planner-worker-economics/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · 工作現場線(編輯:廖玄同),《AI 重寫了 SQLite,帳單差 7.9 倍》,矽基前沿 [Si]gnals,2026-07-21。https://signals.tw/articles/cursor-swarm-planner-worker-economics/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.