
微軟和 Wiz 同一天宣布打贏 Mythos,兩個分數都不在榜上
他們比的是外殼,不是模型。
7 月 27 日微軟說,它的 MDASH 在 CyberGym 上拿到 95.95%,比 Anthropic 的 Mythos 高 12 個百分點。這個數字大到我想自己去榜上看一眼。
榜上沒有它。我在 7 月 30 日讀到的 CyberGym 排行榜,第一名是 Gemini 3.5 Flash Cyber 的 83.2%,第二名 Claude Mythos Preview 83.1%,第三名 GPT-5.5 81.8%。往下數到第十名,沒有 95.95%。同一天發表、宣稱以 90.9% 拿下第一的 Wiz Atlas,也不在上面。
兩個都不在,原因其實不神祕:它們不是模型。 而這正是 7 月 27 日真正發生的事。
同一天,兩家公司交出同一個答案
Wiz(Google 旗下)7 月 27 日發表 Atlas,官方說法是一組「各自使用最適合該任務引擎的專門代理人,像一支資安研究團隊那樣協作」,每個階段「路由到在那個任務上勝出的模型」。它的四個階段是:用 code property graph 畫出攻擊面、平行獵漏洞、對抗式驗證、最後真的觸發執行來證明。官方稱在 grpc、dnsmasq、Kubernetes、gVisor、Linux kernel、containerd 這些被審過無數次的專案裡挖出 200 多個先前未知的漏洞,每一筆回報都附一個由系統自己生成的可用 exploit。
微軟同一天發表 Project Perception,六層架構(訊號與感測、資安情境、模型、harness、專門代理人、執行器)外加紅隊/藍隊/綠隊三支代理人團隊,8 月 3 日進 public preview。它挑的第一個落地場景就是軟體漏洞管理——把新模型 MAI-Cyber-1-Flash 放進 MDASH。
一句話講完兩份公告:打敗前沿模型的不是更聰明的模型,是一群便宜的代理人加上一套路由。
| Wiz Atlas | 微軟 MDASH + MAI-Cyber-1-Flash | |
|---|---|---|
| 發表日 | 2026-07-27 | 2026-07-27 |
| 自報 CyberGym 分數 | 90.9% | 95.95% |
| 架構主張 | 專門代理人各用最強引擎,逐階段路由 | 多模型 harness,特化模型吃掉大部分任務 |
| 另一組證據 | 200+ 個未知漏洞,附可執行 exploit | 無同等揭露 |
| 落地 | 併入 Wiz Code | 8 月 3 日 public preview |
微軟自己揭露的那組比例,比分數有用
MAI-Cyber-1-Flash 是從 MAI-Thinking-1 家族衍生出來的小型、程式碼取向資安模型,微軟稱完全自家從頭訓練。真正值得抄下來的是官方寫明的設計意圖:這顆模型設計上要吃掉最多 90% 的任務,讓 MDASH 只在剩下那 10% 特別難的題目上動用最貴的模型(這次是 GPT-5.4)。
對照組是微軟自己上一代的 MDASH 最佳配置:GPT-5.4 加 GPT-5.4 mini 加 GPT-5.3 codex——三顆全是 OpenAI 的模型。新配置官方稱成本只有舊的一半。
微軟沒有把這件事講成「換掉 OpenAI」,它講的是成本。但兩組配置並排就是這個形狀:一個微軟資安產品裡九成的推理量,從 OpenAI 的模型換成了微軟自己的模型,公布的理由是便宜一半。
榜上的數字長什麼樣
CyberGym 是 UC Berkeley 做的 benchmark,題庫是 188 個開源專案裡 1,507 個真實漏洞、28 種漏洞類型,來源是 OSS-Fuzz 的語料。它分四個難度層,差別在題目給你多少資訊:Level 0 只給你沒修補的程式碼(官方頁面記的成功率是 3.5%)、Level 1 加上一段漏洞描述、Level 2 再加 stack trace、Level 3 直接給你正解 patch。
兩家講的都是 Level 1——第二簡單的那一層,題目已經告訴你有什麼漏洞,你要生出能重現它的 PoC。
要先講清楚三件事,免得這兩個數字被讀過頭。
第一,兩個分數都是自報。The Hacker News 在 7 月 28 日查公開排行榜時,看到的是 Wiz Atlas 7 月 27 日那筆 90.9% 排第一、微軟仍停在 5 月 12 日提交的 88.4%,95.95% 沒有出現;本刊 7 月 30 日讀到的第三方排行榜上,兩個系統都沒有條目,榜上只有模型。第二,這不是誰造假的問題——公開榜是給模型排的,harness 本來就沒有位置。但那也就意味著這兩個數字目前沒有第三方能用同一把尺重新量,而 The Hacker News 指出 token 用量與呼叫次數都沒揭露,連正規化都做不到。第三,Level 1 的分數不等於「找得到未知漏洞」;Atlas 那 200 多個新漏洞是另一種等級的證據,比分數硬。
一個有用的對照:CyberGym 原始論文(2025 年 6 月)記的最佳 agent 成績是 11.9%。十三個月後兩家宣稱 90% 以上。就算兩端不是同一把尺,這條曲線本身值得記住。
微軟三天前才把這個 harness 捐出去
同樣是 7 月 27 日,NVIDIA 召集 37 家成立 Open Secure AI Alliance,交付物清單上微軟那一格填的就是 MDASH——「多模型掃描 harness,調度專門代理人去發現、辯論並證明可利用的漏洞」。本刊當天寫過那份名單和它的差集。
所以同一天、同一個 harness,出現在兩份文件裡:一份是捐給開源資安聯盟的交付物,一份是 8 月 3 日開賣的商業產品。這不衝突,也沒有違反聯盟的任何主張,但它相當清楚地示範了「開源資安工具」在商業上怎麼運作——可以捐的是編排,收錢的是塞進去那顆特化模型。 順帶一個誠實的但書:本刊 7 月 27 日核對聯盟公告時,只確認 MDASH 被列名,沒有確認它的公開倉庫位置。
這一天真正的新聞不是誰的分數高。是兩家公司同時把賭注從模型搬到路由——而路由,是這三件事裡唯一小團隊抄得起的那一件。
你能抄的是路由,不是分數
台灣的小團隊複製不了那兩個分數:你沒有一百個調校過的代理人,也沒有自家特化模型。但微軟公布的那個比例可以直接搬——把便宜的小模型放在最前面吃掉大部分任務,把前沿模型留給它挑不動的那一小撮,成本結構就變了。這件事跟資安沒有必然關係,任何跑代理人的流程都適用;而它之所以值得認真看,是因為這次不是部落格作者的建議,是微軟拿自己的旗艦資安產品這麼做,並且公布了省下多少。
順帶一個判斷 Mythos 位置的參考點:本刊 7 月 29 日寫過 Claude Mythos Preview 在兩個密碼學演算法上的發現——60 小時、約 10 萬美元 API 費用,推翻兩年專家審查沒發現的東西。它在單題深度上做到的事,和這兩套系統在 Level 1 廣度上刷的分數,是兩種能力,不該互相換算。
該盯的是這兩個分數什麼時候上榜
目前能確定的是:兩份 7 月 27 日的公告、兩個自報分數、一組被官方寫明的 90/10 路由比例、以及一個同時出現在開源聯盟與商業產品裡的 harness。
不確定的比較有意思。這兩個數字什麼時候會以可被第三方重量的形式出現在公開榜上?在那之前,95.95% 和 90.9% 是兩份行銷素材,不是兩個可以比較的成績。真正硬的那組證據反而是 Atlas 那 200 多個漏洞——盯它們的 CVE 編號會不會陸續出現,比盯排行榜有用得多。
本篇是官方公告、benchmark 官方頁面與第三方排行榜的文件檢視。本刊沒有跑 CyberGym,也沒有取得任何一方的 harness,兩個分數都無法自行複驗。
SOURCES
- AMicrosoft AI — Introducing MAI-Cyber-1-Flash inside MDASH
- AThe Official Microsoft Blog — Rethinking security for the age of AI
- AWiz — Introducing Atlas: Wiz's AI vulnerability researcher
- ACyberGym(UC Berkeley)— benchmark 官方頁面
- ANVIDIA Blog — Industry Leaders Join Open Secure AI Alliance
- BThe Hacker News — Microsoft Says New Cybersecurity AI Model Helps MDASH Score 95.95% at Half the Cost
- BThe Register — Microsoft and Wiz mind-meld agents catch more than 90% of bugs
- Cllm-stats.com — CyberGym Leaderboard(第三方鏡像)
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明
