紙上概念插畫:牆上一排卡片大小的名次插槽,桌前立著兩具由許多小零件組成、明顯塞不進任何插槽的組合體,一條 Signal Blue 弧線從組合體指向空插槽卻停在槽口之外
工作現場

微軟和 Wiz 同一天宣布打贏 Mythos,兩個分數都不在榜上

他們比的是外殼,不是模型。

7 月 27 日微軟說,它的 MDASH 在 CyberGym 上拿到 95.95%,比 Anthropic 的 Mythos 高 12 個百分點。這個數字大到我想自己去榜上看一眼。

榜上沒有它。我在 7 月 30 日讀到的 CyberGym 排行榜,第一名是 Gemini 3.5 Flash Cyber 的 83.2%,第二名 Claude Mythos Preview 83.1%,第三名 GPT-5.5 81.8%。往下數到第十名,沒有 95.95%。同一天發表、宣稱以 90.9% 拿下第一的 Wiz Atlas,也不在上面。

兩個都不在,原因其實不神祕:它們不是模型。 而這正是 7 月 27 日真正發生的事。

同一天,兩家公司交出同一個答案

Wiz(Google 旗下)7 月 27 日發表 Atlas,官方說法是一組「各自使用最適合該任務引擎的專門代理人,像一支資安研究團隊那樣協作」,每個階段「路由到在那個任務上勝出的模型」。它的四個階段是:用 code property graph 畫出攻擊面、平行獵漏洞、對抗式驗證、最後真的觸發執行來證明。官方稱在 grpc、dnsmasq、Kubernetes、gVisor、Linux kernel、containerd 這些被審過無數次的專案裡挖出 200 多個先前未知的漏洞,每一筆回報都附一個由系統自己生成的可用 exploit。

微軟同一天發表 Project Perception,六層架構(訊號與感測、資安情境、模型、harness、專門代理人、執行器)外加紅隊/藍隊/綠隊三支代理人團隊,8 月 3 日進 public preview。它挑的第一個落地場景就是軟體漏洞管理——把新模型 MAI-Cyber-1-Flash 放進 MDASH。

一句話講完兩份公告:打敗前沿模型的不是更聰明的模型,是一群便宜的代理人加上一套路由。

Wiz Atlas 微軟 MDASH + MAI-Cyber-1-Flash
發表日 2026-07-27 2026-07-27
自報 CyberGym 分數 90.9% 95.95%
架構主張 專門代理人各用最強引擎,逐階段路由 多模型 harness,特化模型吃掉大部分任務
另一組證據 200+ 個未知漏洞,附可執行 exploit 無同等揭露
落地 併入 Wiz Code 8 月 3 日 public preview

微軟自己揭露的那組比例,比分數有用

MAI-Cyber-1-Flash 是從 MAI-Thinking-1 家族衍生出來的小型、程式碼取向資安模型,微軟稱完全自家從頭訓練。真正值得抄下來的是官方寫明的設計意圖:這顆模型設計上要吃掉最多 90% 的任務,讓 MDASH 只在剩下那 10% 特別難的題目上動用最貴的模型(這次是 GPT-5.4)。

對照組是微軟自己上一代的 MDASH 最佳配置:GPT-5.4 加 GPT-5.4 mini 加 GPT-5.3 codex——三顆全是 OpenAI 的模型。新配置官方稱成本只有舊的一半。

微軟沒有把這件事講成「換掉 OpenAI」,它講的是成本。但兩組配置並排就是這個形狀:一個微軟資安產品裡九成的推理量,從 OpenAI 的模型換成了微軟自己的模型,公布的理由是便宜一半。

榜上的數字長什麼樣

CyberGym 是 UC Berkeley 做的 benchmark,題庫是 188 個開源專案裡 1,507 個真實漏洞、28 種漏洞類型,來源是 OSS-Fuzz 的語料。它分四個難度層,差別在題目給你多少資訊:Level 0 只給你沒修補的程式碼(官方頁面記的成功率是 3.5%)、Level 1 加上一段漏洞描述、Level 2 再加 stack trace、Level 3 直接給你正解 patch。

兩家講的都是 Level 1——第二簡單的那一層,題目已經告訴你有什麼漏洞,你要生出能重現它的 PoC。

要先講清楚三件事,免得這兩個數字被讀過頭。

第一,兩個分數都是自報。The Hacker News 在 7 月 28 日查公開排行榜時,看到的是 Wiz Atlas 7 月 27 日那筆 90.9% 排第一、微軟仍停在 5 月 12 日提交的 88.4%,95.95% 沒有出現;本刊 7 月 30 日讀到的第三方排行榜上,兩個系統都沒有條目,榜上只有模型。第二,這不是誰造假的問題——公開榜是給模型排的,harness 本來就沒有位置。但那也就意味著這兩個數字目前沒有第三方能用同一把尺重新量,而 The Hacker News 指出 token 用量與呼叫次數都沒揭露,連正規化都做不到。第三,Level 1 的分數不等於「找得到未知漏洞」;Atlas 那 200 多個新漏洞是另一種等級的證據,比分數硬。

一個有用的對照:CyberGym 原始論文(2025 年 6 月)記的最佳 agent 成績是 11.9%。十三個月後兩家宣稱 90% 以上。就算兩端不是同一把尺,這條曲線本身值得記住。

微軟三天前才把這個 harness 捐出去

同樣是 7 月 27 日,NVIDIA 召集 37 家成立 Open Secure AI Alliance,交付物清單上微軟那一格填的就是 MDASH——「多模型掃描 harness,調度專門代理人去發現、辯論並證明可利用的漏洞」。本刊當天寫過那份名單和它的差集

所以同一天、同一個 harness,出現在兩份文件裡:一份是捐給開源資安聯盟的交付物,一份是 8 月 3 日開賣的商業產品。這不衝突,也沒有違反聯盟的任何主張,但它相當清楚地示範了「開源資安工具」在商業上怎麼運作——可以捐的是編排,收錢的是塞進去那顆特化模型。 順帶一個誠實的但書:本刊 7 月 27 日核對聯盟公告時,只確認 MDASH 被列名,沒有確認它的公開倉庫位置。

這一天真正的新聞不是誰的分數高。是兩家公司同時把賭注從模型搬到路由——而路由,是這三件事裡唯一小團隊抄得起的那一件。

你能抄的是路由,不是分數

台灣的小團隊複製不了那兩個分數:你沒有一百個調校過的代理人,也沒有自家特化模型。但微軟公布的那個比例可以直接搬——把便宜的小模型放在最前面吃掉大部分任務,把前沿模型留給它挑不動的那一小撮,成本結構就變了。這件事跟資安沒有必然關係,任何跑代理人的流程都適用;而它之所以值得認真看,是因為這次不是部落格作者的建議,是微軟拿自己的旗艦資安產品這麼做,並且公布了省下多少。

順帶一個判斷 Mythos 位置的參考點:本刊 7 月 29 日寫過 Claude Mythos Preview 在兩個密碼學演算法上的發現——60 小時、約 10 萬美元 API 費用,推翻兩年專家審查沒發現的東西。它在單題深度上做到的事,和這兩套系統在 Level 1 廣度上刷的分數,是兩種能力,不該互相換算。

該盯的是這兩個分數什麼時候上榜

目前能確定的是:兩份 7 月 27 日的公告、兩個自報分數、一組被官方寫明的 90/10 路由比例、以及一個同時出現在開源聯盟與商業產品裡的 harness。

不確定的比較有意思。這兩個數字什麼時候會以可被第三方重量的形式出現在公開榜上?在那之前,95.95% 和 90.9% 是兩份行銷素材,不是兩個可以比較的成績。真正硬的那組證據反而是 Atlas 那 200 多個漏洞——盯它們的 CVE 編號會不會陸續出現,比盯排行榜有用得多。

本篇是官方公告、benchmark 官方頁面與第三方排行榜的文件檢視。本刊沒有跑 CyberGym,也沒有取得任何一方的 harness,兩個分數都無法自行複驗。

SOURCES

  1. AMicrosoft AI — Introducing MAI-Cyber-1-Flash inside MDASH
  2. AThe Official Microsoft Blog — Rethinking security for the age of AI
  3. AWiz — Introducing Atlas: Wiz's AI vulnerability researcher
  4. ACyberGym(UC Berkeley)— benchmark 官方頁面
  5. ANVIDIA Blog — Industry Leaders Join Open Secure AI Alliance
  6. BThe Hacker News — Microsoft Says New Cybersecurity AI Model Helps MDASH Score 95.95% at Half the Cost
  7. BThe Register — Microsoft and Wiz mind-meld agents catch more than 90% of bugs
  8. Cllm-stats.com — CyberGym Leaderboard(第三方鏡像)

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

CONTINUE READING

繼續讀

編輯部從相同 beat 與主題挑出最可能讓你接著看的三篇。

WEEKLY [SI]GNALS

訂閱《矽基前沿週報》

每週五早上,把本週 AI 與算力產業最值得記住的變化連回台灣。

本週關鍵訊號 · 為什麼值得記住 · 下週觀察 · 5 分鐘讀完。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
工作現場
Key claims
  • 微軟 2026-07-27 表示 MDASH 搭配自家新模型 MAI-Cyber-1-Flash 與 GPT-5.4 在 CyberGym 取得 95.95%,官方並稱該成績較 Anthropic 的 Mythos 高 12 個百分點。
  • 微軟官方寫明 MAI-Cyber-1-Flash 設計上要處理最多 90% 的任務,僅在約 10% 特別困難的任務調用 GPT-5.4,並稱此配置成本約為前一代的一半。
  • 微軟上一代 MDASH 最佳配置為 GPT-5.4、GPT-5.4 mini 與 GPT-5.3 codex,三者皆為 OpenAI 模型。
  • Wiz 於同日 2026-07-27 發表 Atlas,自稱以 90.9% 在 CyberGym 排名第一,並稱在 grpc、dnsmasq、Kubernetes、gVisor、Linux kernel、containerd 等專案找出 200 多個先前未知漏洞,每筆回報均附系統生成的可執行 exploit。
  • 依 The Hacker News 2026-07-28 報導,公開排行榜當時列 Wiz Atlas 的 90.9% 居首、微軟仍為 5 月 12 日提交的 88.4%,95.95% 未出現;該報導並指出 token 用量與呼叫次數未揭露,成績無法獨立重現或正規化。
  • 本刊 2026-07-30 讀到的第三方 CyberGym 排行榜鏡像前三名為 Gemini 3.5 Flash Cyber 83.2%、Claude Mythos Preview 83.1%、GPT-5.5 81.8%,MDASH 與 Wiz Atlas 均無條目。
  • CyberGym 由 UC Berkeley 研究者建立,題庫含 188 個開源專案的 1,507 個真實漏洞與 28 種漏洞類型,分四個難度層;兩家宣稱的成績皆為 Level 1(給定漏洞描述與未修補程式碼,要求產出可重現漏洞的 PoC),官方頁面記 Level 0 的成功率為 3.5%。
  • NVIDIA 於 2026-07-27 成立的 Open Secure AI Alliance 交付物清單將 MDASH 列為微軟的貢獻;同日微軟宣布把 MAI-Cyber-1-Flash 放進 MDASH,並將於 2026-08-03 進入 public preview。
Entities
Microsoft · Project Perception · MAI-Cyber-1-Flash · MDASH · Wiz · Atlas · CyberGym · Claude Mythos Preview · GPT-5.4 · UC Berkeley · Open Secure AI Alliance · OSS-Fuzz
Taiwan relevance
medium
Confidence
medium
Last updated
2026-07-30
Canonical URL
https://signals.tw/articles/cybergym-harness-scores-microsoft-wiz/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · 工作現場線(編輯:廖玄同),《微軟和 Wiz 同一天宣布打贏 Mythos,兩個分數都不在榜上》,矽基前沿 [Si]gnals,2026-07-30。https://signals.tw/articles/cybergym-harness-scores-microsoft-wiz/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.