矽基前沿週報 #003:人類只攔得住13.6%,這週閘一道道被拆
矽基前沿週報 #003:本週最重要的四件事。Claude Code 的 auto mode 今天起變成預設,人類在對照實驗中只攔下 13.6% 危險指令;同一週子代理總量閘拆了、六款編碼代理的核可鍵被一個符號連結繞過、九起 AI 代理刪資料事故只有一家真的道歉。另外 GPT-5.6 的駭客版模型鎖進認證夥伴清單、OpenAI 的十道數學題被兩位數學家抓包沒列引用、一款猜身高的 App 賺 80 萬美元創辦人卻要走。
Anthropic 這週把一個數字攤開來,我覺得比任何一篇評測報告都誠實:把危險指令偷偷塞進Claude Code 的核可提示裡,人類受測者只攔下 13.6%;而且攔截率不是穩定的——一開始約 17%,同一個 session 累積 50 次提示之後掉到約 5%。分類器攔下 89%。8 月 14 日起,這套分類器成為 Pro、Max、Team 方案新 session 的預設,逐一詢問退成選配。
我讀這個數字的方式很直接:官方不是在說「AI 比人可靠」,是在說「人在這件事上本來就不可靠,尤其是做久了以後」。這句話不舒服,但它是這週唯一一個有對照組的數字,其他大多是自報。
同一週,另外三道閘也在鬆手
方向一致,只是沒人講出「一致」兩個字。Claude Code 拿掉了子代理總量上限,併發與深度限制還在,鬆的只有總量。Wiz Research 揭露六款編碼代理的核可對話框都能被一個符號連結騙過——你在對話框看到的檔名,跟代理實際寫入的路徑不是同一個;Anthropic 把這個回報標成「不在威脅模型內」。自架環境測試版把執行搬進你自己的機房,但對話本身仍送去 Anthropic 做推論,留下的是 checkout 跟密鑰,出去的是整段提示詞。
把這幾件事疊在一起看,九起 AI 代理刪除正式環境資料的事故整理剛好在同一週出爐:六款工具、九起事故,Google 上了 Secure Mode、Replit 執行長公開道歉並拆分資料庫、Amazon 說是設定錯誤,Anthropic 跟 Cursor 至今沒有公開事後檢討。決定權正在從人手上收回去,這件事我同意方向;但防線有沒有同步補上,這週看到的答案是還沒——而「沒同步補上」剛好是最容易被忽略的那一格。
這週你真的可以做的一件事:如果你的團隊開了 auto mode,去確認一下專案資料夾裡有沒有符號連結——GhostApproval 那個漏洞不挑廠牌,六款工具全中。
駭客版模型不轉交給你,轉交給認證過的人
GPT-5.6-Cyber 這款專攻漏洞利用鏈的模型也在這週上線,官方稱任務完成率 95%,是通用版 GPT-5.6 Sol 的六十幾倍。但它不對一般使用者開放——存取權鎖在 Accenture、IBM、CrowdStrike 這類認證夥伴手上。我的讀法:控制點沒有消失,只是從「模型會不會拒答」搬到「誰批得到夥伴資格」。跟前面幾道核可閘其實是同一個故事——安全機制正在往你看不到的那一層移動。
「十年沒人推進」,兩位數學家說沒那回事
OpenAI 公布 Astra 解出十道數學難題那則公告,我原本沒特別在意,直到兩位數學家先後跳出來:Steven Miller 說高維球堆積那題沿用他 2016 年的論證卻沒列引用;劍橋的 Francesco Fournier-Facio 說 non-sofic groups 那題是拼接兩篇既有論文,形容是「灌水」。OpenAI「至少十年沒人推進」那句話後來悄悄改了措辭。我不做研究倫理的裁判,但這件事讓我確認一個判準:AI 宣稱的科研突破,在有人真的去核對引用之前,先當成「未經同行審查的部落格文章」讀,不要當成「已驗證的結果」讀。
一款猜身高的 App 賺 80 萬美元,創辦人卻要走
輕鬆一點的一則:GoTall,一款猜你以後會長多高的 App,核實出累計營收 81.5 萬美元、1.68 萬個訂閱。創辦人自己在核實頁面留言說要去做別的了,兩位共同創辦人也分開。一個能賺錢的 AI-native 小產品,跟創辦人想不想繼續做,原來是兩件事——驗證一門生意能不能賺錢,跟驗證這門生意值不值得你的人生,用的不是同一把尺。
我們這週沒寫的
有報導指出,這週三家資安新創合計募得約 2.7 億美元,瞄準同一個問題:AI 代理在企業系統裡跑,攻擊面已經超出現有工具能防的範圍。跟前面那幾道被拆的閘放在一起看,這筆錢流向的方向很清楚,但我們還沒逐輪查證金額與投資方,也還沒挖到值得單獨成篇的細節,先記一筆,欠讀者一篇。
下週見。
查核備註:本期各段數字與引語的完整來源標記在各篇原文的查核備註;本刊未在原文之外做額外查證。資安募資一段引自公開新聞彙整,尚未逐一查證各輪金額與投資方,屬待補。