Kimi K3 週一開權重,安全閘沒攔住它動手
分數落後,不代表沒事。
這兩天多家科技媒體在轉的版本是這樣的:英美兩國政府測了 Kimi K3 的攻擊能力,32% 對上美國模型的 76.2%,中國模型大幅落後。
去翻一手文件,那組對比不在裡面。英國 AI Security Institute(UK AISI)與美國 CAISI 在 7 月 23 日放出的評測報告沒有給任何跨 benchmark 的聚合百分比,只給了單項成績。而單項成績裡最刺眼的兩格,都不是被轉的那一格。
第一格:41 項任務,Kimi K3 一項都沒打穿。第二格是一句話,報告全文裡最短的段落之一——它的安全機制,沒有阻止它動手。而 Moonshot AI 說好的權重釋出日是 7 月 27 日,這個星期一。
41 項任務,K3 一項都沒打穿,領先模型平均打穿 20 項
評測用的第一個工具是 ExploitBench,Carnegie Mellon 做的軟體漏洞利用測驗,看模型能不能一路把一個漏洞推進成可用的攻擊程式。
Kimi K3 的成功率是 32%。同為開放權重的 GLM-5.2 是 24%。這是被轉最多的那個數字,也是最不重要的那個。
真正的分野在下一行:在全部 41 項任務裡,Kimi K3 沒有任何一項做出能達成任意程式碼執行(arbitrary code execution,ACE)的攻擊程式。0 比 41。同一組任務,領先的模型平均做出 20 項。
差距不是均勻攤在整條難度曲線上的。K3 拿得到部分分數,拿不到最後那一下——把漏洞變成「我現在能在你機器上跑我的程式」的那一步。
32 步的靶場,它走到第 17 步;但十次裡有一次全破
第二個工具叫 The Last Ones(TLO),一座模擬的企業網路靶場。整套情境 32 步,報告說一位專家大約要花 20 小時走完。
Kimi K3 平均推進到第 17 步。領先的美國模型平均 28.5 步。GLM-5.2 平均第 11 步。
然後是那個容易被平均值蓋掉的細節:10 次嘗試裡,Kimi K3 有 1 次把整座靶場走完了。CAISI 那份公告用一句話點出這件事的意義——能全破 TLO 的模型,已經不再侷限於少數幾個。
平均第 17 步和「十次有一次全破」是同一個模型的兩張臉。前者讓人放心,後者不會。
三方並排,但最後一列才是地雷
把三方並排,但每一欄都要記得它是在什麼條件下量出來的——這一點報告自己寫得很清楚,轉述稿幾乎都漏了。
| 項目 | Kimi K3(開放權重,7/27 釋出) | GLM-5.2(開放權重) | 領先的美國前沿模型(閉源,未具名) |
|---|---|---|---|
| ExploitBench 成功率 | 32% | 24% | 報告未給單一百分比 |
| 41 項任務中達成 ACE | 0 | 報告未列 | 平均 20 |
| TLO 靶場平均推進步數(滿分 32) | 第 17 步 | 第 11 步 | 第 28.5 步 |
| 10 次嘗試中全破次數 | 1 | 報告未列 | 報告未列 |
| 受測時的安全防護狀態 | 模型自身安全機制開著 | 同左 | 系統層防護關閉 |
最後一列是整張表的地雷。美國閉源模型是在關掉系統層防護的狀態下受測的——那量的是模型底層能力,不是你今天打開 API 會遇到的那個產品。拿這張表去說「市售美國模型比較會打」,方向就錯了。
報告裡最短的那句話:安全閘沒攔住
原文是這樣一句:Kimi K3 的安全機制「沒有阻止它嘗試開發攻擊程式或進行攻擊操作」。
報告另外寫下一句更具體的:在被指示、而且已經取得初始網路存取權的前提下,Kimi K3 能自主攻擊小型、防護薄弱、本身就有漏洞的企業系統。
這兩句話講的是同一件事的兩半——它願意動手,而且在夠弱的目標上動得起來。它沒有說 K3 在評測中打下了誰,也沒有說它做出了可用的高階攻擊程式(那一格是 0/41)。這兩句話的界線就到這裡,再往外推都是別人加的。
我們的讀法是:這句話的保存期限只到星期一。權重一旦公開,模型自帶的安全機制就是可以被移除、被微調掉的東西——「安全閘攔不攔得住」不再是模型的屬性,是下載的人的選擇。
這不是我們發明的推論。它就寫在隔天的另一份文件裡。
隔天,25 家公司連署信自己寫了同一個風險
7 月 24 日,NVIDIA、Microsoft、Meta、Hugging Face、IBM、Mistral、Mozilla、Palantir、CrowdStrike、Replit、ServiceNow、Y Combinator、Andreessen Horowitz 等 25 家組織連署了一封信,《Open Weights and American AI Leadership》,要求政策端不要「過早限制」開放權重模型。
信裡有這麼一段:開放權重帶著真實而獨特的風險,權重一旦釋出就脫離原開發者的控制,被改動過的版本難以追蹤或回溯。
同一段的下一句是:對這個風險的正確回應不是禁止開放權重。理由是攻擊方已經在用先進 AI,防守方需要能力相當的模型才能偵測、模擬、應對。
兩份文件,隔一天,講的是同一個機制——安全閘不會跟著權重走——然後給出相反的結論。政府那邊量到它,產業這邊承認它然後說禁不是解方。
名單上還有一件事:發布當天的 25 家裡,OpenAI、Anthropic、Google 都不在上面。(本刊 7 月 26 日重抓官方 PDF,署名已是 35 家、OpenAI 在列,Anthropic 與 Google 仍不在——見〈白宮放話制裁蒸餾,兩天後 35 家公司連署要華府收手〉。)連署信另外要求,distillation(用一個模型的輸出協助訓練另一個模型)這種普遍技術,不該和非法擷取閉源模型價值混為一談,後者應該用個案的法律與商業手段處理,而不是全面限制技術本身。
這份評測沒有測到什麼?
報告自己列了限制,這是它最誠實的部分,也是你星期一真正用得上的部分:
- 這是初步評測,只跑了一小組公開與非公開的 benchmark,不是完整能力盤點。
- Kimi K3 的整體攻擊能力只由單一 benchmark 估計,所以信賴區間比其他模型寬——32% 這個數字本身的精度就不高。
- 美國閉源模型是在系統層防護關閉的條件下受測,跨欄比較的是底層能力,不是產品。
- TLO 靶場和真實環境有明確落差:沒有主動防守方、沒有防禦工具、對會觸發資安告警的行為沒有任何懲罰,而且靶場裡本來就留了一條刻意設計的攻擊路徑。
第 4 點是自架評估時最該補的一格。報告量的是「一個模型在無人防守的乾淨靶場能走多遠」,你的環境裡有沒有防守方、告警接不接得住、初始存取權有多容易拿到,這三件事報告一件都沒回答,而它們決定了第 17 步在你這裡等於什麼。
星期一之後,Moonshot 官方尚未公布 K3 權重的授權條款,二手來源說是 Modified MIT,一手還沒有。真正會變的只有一件事:今天這份報告量的是一個帶著安全機制的模型,7 月 27 日之後,任何人手上那份都不一定還帶著。
FAQ
常見問題
- UK AISI 與 CAISI 對 Kimi K3 的評測結論是什麼?
- 兩機構在 2026 年 7 月 23 日公布初步評測,結論是 Kimi K3 的攻擊能力顯著低於最新一批具攻擊能力的前沿模型。具體成績:ExploitBench 成功率 32%,但 41 項任務中沒有一項做出可達成任意程式碼執行的攻擊程式(領先模型平均 20 項);在 32 步的「The Last Ones」模擬企業網路靶場平均推進到第 17 步,領先模型平均 28.5 步,10 次嘗試中有 1 次全破。
- 那個「32% 對 76.2%」的對比是哪來的?
- 不在一手文件裡。UK AISI 的報告與 NIST/CAISI 的公告都沒有給跨 benchmark 的聚合百分比,只給單項成績(ExploitBench 32%、靶場平均第 17 步)。76.2% 這個數字出現在多家科技媒體的轉述稿,一手報告查不到。
- 這份評測沒有測到什麼?
- 報告自己列了四項限制:屬初步評測、benchmark 數量少;美國閉源模型是在系統層防護被關閉的條件下受測,量的是底層能力不是市售產品;Kimi K3 的整體能力只由單一 benchmark 估計,信賴區間較寬;靶場沒有主動防守方與防禦工具、對觸發資安告警的行為沒有懲罰,且內含一條刻意留下的攻擊路徑。
SOURCES
- A UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities(UK AI Security Institute,2026-07-23)
- A UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities(NIST/CAISI 公告,2026-07-23)
- A Open Weights and American AI Leadership(25 家組織連署信全文,2026-07-24)
- B Nvidia and 24 other companies sign open-weights letter as Washington weighs Chinese AI model ban(Tom's Hardware)
- C UK and US AI Safety Institutes Find Kimi K3 Scores 32% on Cyber Exploits vs. 76% for US Models(MLQ News,本文引為「被廣泛轉述的版本」範例)
來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。
UPDATE HISTORY
- First published.
- 補正連署名單。本文原寫「OpenAI、Anthropic、Google 都不在這 25 家裡面」,那是 7 月 24 日發布當天各家報導記載的狀態。本刊 7 月 26 日重新抓取 nvidia.com 上託管的連署信 PDF,署名清單已是 35 家、OpenAI 在列;Anthropic、Google、Amazon、xAI 仍不在名單上。
本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明