矽基前沿 [Si]gnals
一張編輯插畫,畫面下方是 32 格的評測步階,前 17 格點亮、其餘暗著,左側前景立著一道敞開沒人看守的閘門
AI 戰爭

Kimi K3 週一開權重,安全閘沒攔住它動手

分數落後,不代表沒事。

這兩天多家科技媒體在轉的版本是這樣的:英美兩國政府測了 Kimi K3 的攻擊能力,32% 對上美國模型的 76.2%,中國模型大幅落後。

去翻一手文件,那組對比不在裡面。英國 AI Security Institute(UK AISI)與美國 CAISI 在 7 月 23 日放出的評測報告沒有給任何跨 benchmark 的聚合百分比,只給了單項成績。而單項成績裡最刺眼的兩格,都不是被轉的那一格。

第一格:41 項任務,Kimi K3 一項都沒打穿。第二格是一句話,報告全文裡最短的段落之一——它的安全機制,沒有阻止它動手。而 Moonshot AI 說好的權重釋出日是 7 月 27 日,這個星期一。

41 項任務,K3 一項都沒打穿,領先模型平均打穿 20 項

評測用的第一個工具是 ExploitBench,Carnegie Mellon 做的軟體漏洞利用測驗,看模型能不能一路把一個漏洞推進成可用的攻擊程式。

Kimi K3 的成功率是 32%。同為開放權重的 GLM-5.2 是 24%。這是被轉最多的那個數字,也是最不重要的那個。

真正的分野在下一行:在全部 41 項任務裡,Kimi K3 沒有任何一項做出能達成任意程式碼執行(arbitrary code execution,ACE)的攻擊程式。0 比 41。同一組任務,領先的模型平均做出 20 項。

差距不是均勻攤在整條難度曲線上的。K3 拿得到部分分數,拿不到最後那一下——把漏洞變成「我現在能在你機器上跑我的程式」的那一步。

32 步的靶場,它走到第 17 步;但十次裡有一次全破

第二個工具叫 The Last Ones(TLO),一座模擬的企業網路靶場。整套情境 32 步,報告說一位專家大約要花 20 小時走完。

Kimi K3 平均推進到第 17 步。領先的美國模型平均 28.5 步。GLM-5.2 平均第 11 步。

然後是那個容易被平均值蓋掉的細節:10 次嘗試裡,Kimi K3 有 1 次把整座靶場走完了。CAISI 那份公告用一句話點出這件事的意義——能全破 TLO 的模型,已經不再侷限於少數幾個。

平均第 17 步和「十次有一次全破」是同一個模型的兩張臉。前者讓人放心,後者不會。

三方並排,但最後一列才是地雷

把三方並排,但每一欄都要記得它是在什麼條件下量出來的——這一點報告自己寫得很清楚,轉述稿幾乎都漏了。

項目Kimi K3(開放權重,7/27 釋出)GLM-5.2(開放權重)領先的美國前沿模型(閉源,未具名)
ExploitBench 成功率32%24%報告未給單一百分比
41 項任務中達成 ACE0報告未列平均 20
TLO 靶場平均推進步數(滿分 32)第 17 步第 11 步第 28.5 步
10 次嘗試中全破次數1報告未列報告未列
受測時的安全防護狀態模型自身安全機制開著同左系統層防護關閉

最後一列是整張表的地雷。美國閉源模型是在關掉系統層防護的狀態下受測的——那量的是模型底層能力,不是你今天打開 API 會遇到的那個產品。拿這張表去說「市售美國模型比較會打」,方向就錯了。

報告裡最短的那句話:安全閘沒攔住

原文是這樣一句:Kimi K3 的安全機制「沒有阻止它嘗試開發攻擊程式或進行攻擊操作」。

報告另外寫下一句更具體的:在被指示、而且已經取得初始網路存取權的前提下,Kimi K3 能自主攻擊小型、防護薄弱、本身就有漏洞的企業系統。

這兩句話講的是同一件事的兩半——它願意動手,而且在夠弱的目標上動得起來。它沒有說 K3 在評測中打下了誰,也沒有說它做出了可用的高階攻擊程式(那一格是 0/41)。這兩句話的界線就到這裡,再往外推都是別人加的。

我們的讀法是:這句話的保存期限只到星期一。權重一旦公開,模型自帶的安全機制就是可以被移除、被微調掉的東西——「安全閘攔不攔得住」不再是模型的屬性,是下載的人的選擇。

這不是我們發明的推論。它就寫在隔天的另一份文件裡。

隔天,25 家公司連署信自己寫了同一個風險

7 月 24 日,NVIDIA、Microsoft、Meta、Hugging Face、IBM、Mistral、Mozilla、Palantir、CrowdStrike、Replit、ServiceNow、Y Combinator、Andreessen Horowitz 等 25 家組織連署了一封信,《Open Weights and American AI Leadership》,要求政策端不要「過早限制」開放權重模型。

信裡有這麼一段:開放權重帶著真實而獨特的風險,權重一旦釋出就脫離原開發者的控制,被改動過的版本難以追蹤或回溯。

同一段的下一句是:對這個風險的正確回應不是禁止開放權重。理由是攻擊方已經在用先進 AI,防守方需要能力相當的模型才能偵測、模擬、應對。

兩份文件,隔一天,講的是同一個機制——安全閘不會跟著權重走——然後給出相反的結論。政府那邊量到它,產業這邊承認它然後說禁不是解方。

名單上還有一件事:發布當天的 25 家裡,OpenAI、Anthropic、Google 都不在上面。(本刊 7 月 26 日重抓官方 PDF,署名已是 35 家、OpenAI 在列,Anthropic 與 Google 仍不在——見〈白宮放話制裁蒸餾,兩天後 35 家公司連署要華府收手〉。)連署信另外要求,distillation(用一個模型的輸出協助訓練另一個模型)這種普遍技術,不該和非法擷取閉源模型價值混為一談,後者應該用個案的法律與商業手段處理,而不是全面限制技術本身。

這份評測沒有測到什麼?

報告自己列了限制,這是它最誠實的部分,也是你星期一真正用得上的部分:

  1. 這是初步評測,只跑了一小組公開與非公開的 benchmark,不是完整能力盤點。
  2. Kimi K3 的整體攻擊能力只由單一 benchmark 估計,所以信賴區間比其他模型寬——32% 這個數字本身的精度就不高。
  3. 美國閉源模型是在系統層防護關閉的條件下受測,跨欄比較的是底層能力,不是產品。
  4. TLO 靶場和真實環境有明確落差:沒有主動防守方、沒有防禦工具、對會觸發資安告警的行為沒有任何懲罰,而且靶場裡本來就留了一條刻意設計的攻擊路徑。

第 4 點是自架評估時最該補的一格。報告量的是「一個模型在無人防守的乾淨靶場能走多遠」,你的環境裡有沒有防守方、告警接不接得住、初始存取權有多容易拿到,這三件事報告一件都沒回答,而它們決定了第 17 步在你這裡等於什麼。

星期一之後,Moonshot 官方尚未公布 K3 權重的授權條款,二手來源說是 Modified MIT,一手還沒有。真正會變的只有一件事:今天這份報告量的是一個帶著安全機制的模型,7 月 27 日之後,任何人手上那份都不一定還帶著。

FAQ

常見問題

UK AISI 與 CAISI 對 Kimi K3 的評測結論是什麼?
兩機構在 2026 年 7 月 23 日公布初步評測,結論是 Kimi K3 的攻擊能力顯著低於最新一批具攻擊能力的前沿模型。具體成績:ExploitBench 成功率 32%,但 41 項任務中沒有一項做出可達成任意程式碼執行的攻擊程式(領先模型平均 20 項);在 32 步的「The Last Ones」模擬企業網路靶場平均推進到第 17 步,領先模型平均 28.5 步,10 次嘗試中有 1 次全破。
那個「32% 對 76.2%」的對比是哪來的?
不在一手文件裡。UK AISI 的報告與 NIST/CAISI 的公告都沒有給跨 benchmark 的聚合百分比,只給單項成績(ExploitBench 32%、靶場平均第 17 步)。76.2% 這個數字出現在多家科技媒體的轉述稿,一手報告查不到。
這份評測沒有測到什麼?
報告自己列了四項限制:屬初步評測、benchmark 數量少;美國閉源模型是在系統層防護被關閉的條件下受測,量的是底層能力不是市售產品;Kimi K3 的整體能力只由單一 benchmark 估計,信賴區間較寬;靶場沒有主動防守方與防禦工具、對觸發資安告警的行為沒有懲罰,且內含一條刻意留下的攻擊路徑。

SOURCES

  1. A UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities(UK AI Security Institute,2026-07-23)
  2. A UK AISI / CAISI Preliminary Assessment of Kimi K3's Cyber Capabilities(NIST/CAISI 公告,2026-07-23)
  3. A Open Weights and American AI Leadership(25 家組織連署信全文,2026-07-24)
  4. B Nvidia and 24 other companies sign open-weights letter as Washington weighs Chinese AI model ban(Tom's Hardware)
  5. C UK and US AI Safety Institutes Find Kimi K3 Scores 32% on Cyber Exploits vs. 76% for US Models(MLQ News,本文引為「被廣泛轉述的版本」範例)

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

UPDATE HISTORY

  1. First published.
  2. 補正連署名單。本文原寫「OpenAI、Anthropic、Google 都不在這 25 家裡面」,那是 7 月 24 日發布當天各家報導記載的狀態。本刊 7 月 26 日重新抓取 nvidia.com 上託管的連署信 PDF,署名清單已是 35 家、OpenAI 在列;Anthropic、Google、Amazon、xAI 仍不在名單上。

本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

WEEKLY [SI]GNALS

訂閱《矽基前沿週報》

每週五早上,把本週 AI 與算力產業最值得記住的變化連回台灣。

本週關鍵訊號 · 為什麼值得記住 · 下週觀察 · 5 分鐘讀完。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
AI 戰爭
Key claims
  • 英國 AI Security Institute(UK AISI)與美國 CAISI 於 2026 年 7 月 23 日公布對 Moonshot AI 旗下 Kimi K3 的初步攻擊能力評測,結論為 K3 的表現顯著低於最新一批具攻擊能力的前沿模型。
  • 在 Carnegie Mellon 的 ExploitBench 上 Kimi K3 成功率為 32%,但在全部 41 項任務中沒有任何一項做出可達成任意程式碼執行(ACE)的攻擊程式,領先模型平均為 41 項中的 20 項。
  • 在 32 步、專家約需 20 小時完成的「The Last Ones」模擬企業網路靶場中,Kimi K3 平均推進到第 17 步,領先的美國模型平均 28.5 步;10 次嘗試中 Kimi K3 有 1 次完成整套情境。對照的開放權重模型 GLM-5.2 為 ExploitBench 24%、靶場平均第 11 步。
  • 報告寫明 Kimi K3 的安全機制並未阻止它在評測中嘗試開發攻擊程式或執行攻擊操作,並指出在被指示且已取得初始網路存取權的前提下,它能自主攻擊小型、防護薄弱的企業系統。
  • 評測自陳限制:屬初步評測、benchmark 數量少;美國閉源模型是在系統層防護被關閉的條件下受測;Kimi K3 的整體能力估計因僅採單一 benchmark 而信賴區間較寬;靶場沒有主動防守方與防禦工具、對觸發資安告警的行為沒有懲罰,且內含一條刻意留下的攻擊路徑。
  • 2026 年 7 月 24 日,包含 NVIDIA、Microsoft、Meta、Hugging Face、Palantir、Y Combinator 在內的 25 家組織連署《Open Weights and American AI Leadership》,信中承認權重一旦釋出就脫離原開發者控制、改版難以追蹤或回溯,但主張正確的回應不是禁止開放權重。
  • Kimi K3 於 2026 年 7 月 16 日發布,總參數 2.8 兆,權重預計 2026 年 7 月 27 日前釋出。
Entities
Kimi K3 · Moonshot AI · UK AI Security Institute · CAISI · NIST · ExploitBench · The Last Ones · Carnegie Mellon University · GLM-5.2 · NVIDIA · Microsoft · Meta · Hugging Face
Taiwan relevance
medium
Confidence
high
Last updated
2026-07-26
Canonical URL
https://signals.tw/articles/kimi-k3-cyber-eval-open-weights/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · AI 戰爭線(編輯:廖玄同),《Kimi K3 週一開權重,安全閘沒攔住它動手》,矽基前沿 [Si]gnals,2026-07-25。https://signals.tw/articles/kimi-k3-cyber-eval-open-weights/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.