編輯資訊圖:由左至右的流程——左邊一張藍色紙卡寫著政策問句「這段內容是否鼓吹肢體暴力?」,中間一個標示「Shieldstral 3B/Apache 2.0」的模組方塊,左緣有文字與圖片兩個小圖示標著「文字 + 圖片」,右邊一條可調滑桿標著「連續分數,門檻自己定」
前沿基建

審查規則不用再重訓模型,寫成一句白話送進去就好

Mistral 的 Shieldstral,3B、Apache 2.0、圖文一起看。

你的產品如果要擋使用者貼進來的東西、或是檢查模型自己吐出來的東西,過去兩條路都不太舒服:接雲端審查 API,規則是別人的;自己拿開放權重的 guard 模型微調一版,每改一次政策就得重訓一次。

Mistral 8 月 4 日開了 Shieldstral,把政策搬到呼叫的時候才給。

輸入分三段:<Instruct> 講評判情境與嚴格程度、<Query> 是一個是非題(例如「這段內容是否鼓吹肢體暴力?」)、<Document> 放要判的東西,提示詞、回覆或圖片都行。輸出不是標籤,是 yesno 兩個 logit 做 softmax 之後的連續分數,門檻你自己定。改政策等於改那句問句,不碰權重。

規格是 Shieldstral-1.0-3B:30 億參數、Apache 2.0、單張 16GB GPU 跑得動,權重放在 Hugging Face。官方稱它在文字安全、拒答偵測、政策適應、多模態四個面向上,追平或勝過體積達七倍的開源 guard 模型——但沒點名比較對象,也沒列出資料集。

台灣團隊先確認一件事:官方在文末自己寫了還在「繼續推進多語言覆蓋」,意思是多語目前列在待改進項裡。繁體中文判得準不準,你得拿自己的語料跑一輪才知道,別照著官方那句跑分排上線時程。還有一件我會先處理的事——這種「把政策寫成一句話送進去」的介面,本身就是 prompt injection 的攻擊面:被判的內容裡如果藏了指令,它跟你的政策問句待在同一個上下文裡。

查核備註:規格、介面與跑分出自 Mistral 官方公告與 Hugging Face 模型頁;跑分是官方自報,我沒跑過這個模型,也沒拿繁中語料測過它。

FAQ

常見問題

Shieldstral 跟以前的 guard 模型差在哪?
政策的位置不同。傳統 guard 模型把審查分類寫進權重,改政策就要重新訓練或微調;Shieldstral 讓你在推論時用一句白話的是非題把政策送進去,模型回一個連續分數。改政策等於改那句問句,不必動權重。
Shieldstral 支援繁體中文嗎?
官方公告沒有給出語言支援清單,並自陳多語言覆蓋仍在持續推進中。繁體中文的判準是否可靠,需要用自己的真實語料實測後才能決定要不要上線,不建議直接套用官方跑分。

SOURCES

  1. AShieldstral | Mistral AI
  2. Amistralai/Shieldstral-1.0-3B | Hugging Face

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

WEEKLY [SI]GNALS

訂閱《矽基前沿週報》

每週五早上,把本週 AI 與算力產業最值得記住的變化連回台灣。

本週關鍵訊號 · 為什麼值得記住 · 下週觀察 · 5 分鐘讀完。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
前沿基建
Key claims
  • Mistral 於 2026 年 8 月 4 日發表 Shieldstral-1.0-3B,30 億參數、Apache 2.0 授權,權重公開在 Hugging Face,官方稱單張 16GB GPU 即可執行。
  • Shieldstral 的審查政策在推論時以白話問句給定,不寫進權重,因此改政策不需要重新訓練模型。
  • 它的輸入分為 <Instruct>(情境與嚴格程度)、<Query>(是非題形式的政策問句)、<Document>(待判的提示詞、回覆或圖片)三段。
  • 輸出不是離散標籤,而是讀取 yes 與 no 兩個 logit 並經 softmax 正規化後的連續安全分數,門檻由部署方自行設定。
  • 官方稱 Shieldstral 在文字安全、拒答偵測、政策適應與多模態四個面向上追平或勝過體積達七倍的開源 guard 模型,但公告未點名比較對象,也未列出評測資料集名稱。
  • Mistral 官方公告自陳多語言覆蓋、長文件穩健度與更廣的多模態安全仍在持續推進中,繁體中文表現需使用者自行驗證。
Entities
Mistral · Shieldstral · Shieldstral-1.0-3B · Hugging Face · Apache 2.0
Taiwan relevance
medium
Confidence
high
Last updated
2026-08-06
Canonical URL
https://signals.tw/articles/mistral-shieldstral-policy-at-inference/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · 前沿基建線(編輯:廖玄同),《審查規則不用再重訓模型,寫成一句白話送進去就好》,矽基前沿 [Si]gnals,2026-08-05。https://signals.tw/articles/mistral-shieldstral-policy-at-inference/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.