矽基前沿 [Si]gnals
編輯型概念插畫:四張標著 Video、Action、Image、Dev 的卡片由上而下排列,前兩張前方的閘門已打開並有藍色箭頭通過,Image 與 Dev 前方的閘門仍緊閉,畫面右側是一支深灰機械手臂
AI 戰爭

FLUX 3 先放影片和機器手,畫圖的排最後

成名靠畫圖的,這次畫圖排最後。

看到 FLUX 出新版,多數人的反射動作是去找權重、或直接開一張圖來試。這次兩件都做不到。

Black Forest Labs 在 2026 年 7 月 23 日發表 FLUX 3,官方那份可用性清單是這樣排的:影片(FLUX 3 Video)和機器人動作預測(FLUX 3 Action)今天就開早期測試;圖像(FLUX 3 Image)「未來幾週」;開放權重的 FLUX 3 Dev「今年稍晚」。

這家公司是靠開放權重的圖像模型出名的。這次發表,圖像排第三,開放權重排第四。

像一間以麵包起家的店開了新分店,開幕當天賣咖啡、賣三明治,麵包櫃還蓋著布。

三條線只有兩條開門,圖像那條還鎖著

先把 FLUX 3 本身講清楚。官方說法是圖像、影片、聲音、動作預測共用同一套架構聯合訓練,架構名字叫 Self-Flow,重點在多模態的生成與理解對齊在同一個底層,不是把四個模型接在同一個介面後面。影片這條能從文字、圖片或既有影片生出最長 20 秒的片段,聲音是跟著畫面一起生的,官方特別點名它在「聲音對上物理事件」和多語對白這兩件事上的表現。

聽起來很完整。但你今天實際能碰到的,只有下面這張表的前兩列:

版本今天的狀態怎麼拿到開放權重
FLUX 3 Video早期測試開放中官方 API/申請早期測試未提供
FLUX 3 Action早期測試,限選定合作方透過與 mimic robotics 合作的 FLUX-mimic未提供
FLUX 3 Image「未來幾週」推出尚未開放未提供
FLUX 3 Dev「今年稍晚」尚未開放官方承諾釋出開放權重

兩個「未來」都沒有日期。價格也沒有——官方公告和新聞稿都只寫商業存取走 API 與私有權重授權,一個數字都沒給。想在自己機器上跑的人,目前連 ComfyUI 原生支援都還沒有,要用就得走官方那條路。

台灣的設計和行銷團隊其實一直在用 FLUX,只是多半不知道——它藏在 Canva、Picsart、Adobe 這些工具的生成功能底下。這波發表對這群人的實際影響是零:底層還沒換。

77% 和 93% 是偏好票,不是分數

官方公告裡最搶眼的是三組數字,全部來自 Black Forest Labs 自己或合作方。攤開來看是這樣:

數字誰測的對照組/場景可驗證程度
影片偏好率 77%/93%/約 52%Black Forest Labs 自家的人類偏好測試對 Runway Gen-4.5 為 77%、對 Luma Ray 3.2 為 93%、對 Gemini Omni 與 Seedance 約 52%樣本數、評分者組成、提示詞集合都沒公布;官方自稱結果為初步,影像與影片評估在中期訓練階段做的
約 30 分鐘機器人資料完成微調(先前方法需 30 小時以上)Black Forest Labs 與 mimic robotics未界定哪些任務適用無獨立驗證
約 101 毫秒反應時間經 Decrypt 記載Audi 車門封條安裝測試單一媒體記載,官方未附數據表

執行長 Robin Rombach 在新聞稿裡的說法是 FLUX 3 Video 在早期評估中「已經領先前沿影片模型」。這句話成立的範圍,就是上面那張表第一列的括號內容——自家找人投的票,對手名單自己選的。

52% 那個數字反而比 93% 誠實:對上 Gemini Omni 和 Seedance,這基本上是平手。

30 分鐘的機器人資料,換掉 30 小時

真正的新東西在動作預測這條線。Black Forest Labs 跟瑞士機器人公司 mimic robotics 合作,把 FLUX 3 的影片預測能力接上一個輕量解碼器去輸出機器人動作,成果叫 FLUX-mimic。mimic robotics 技術長 Elvis Nava 掛名背書的那個數字是:部分任務只要約 30 分鐘的機器人資料就能微調完成,先前的方法要 30 小時以上。

Audi 正在測的場景是車門封條安裝——那種形狀會變、位置每次都不太一樣、傳統自動化很難吃下來的工序。Decrypt 記到的反應時間是約 101 毫秒。這是測試,不是產線導入,兩者差很遠。

這條線背後的想法很直接:影片模型為了把下一幀猜對,被迫學會重量、接觸、時序這些東西。學會之後,接一個解碼器就能拿去指揮機械手。示範資料的採集成本,一直是機器人學習最貴的一段;如果 30 分鐘這個量級站得住,貴的那一段就被削掉一大塊。條件是「如果」——這是廠商聲稱,沒有第三方複現。

這家公司在賭什麼?

Black Forest Labs 2024 年才成立,團隊約 100 人,據點在德國 Freiburg 和舊金山,估值 32.5 億美元,募資超過 4.5 億美元,投資人名單裡有 a16z、Salesforce Ventures、NVIDIA、Adobe、Figma、Canva。早期測試名單上是 Canva、Burda、Magnific、Krea、Picsart 和 Audi——前五個是創作工具,最後一個是車廠。

把出貨順序和這份名單並排看,我們的讀法是:Black Forest Labs 不打算再靠圖像模型定義自己。它把影片生成當成學物理的路徑,終點指向機器人動作。圖像那條線變成既有生態的維護工作,所以可以排後面;開放權重是社群關係的維護工作,所以排更後面。

會有人不同意,理由也很硬:出貨順序常常只是工程排程,圖像那條可能單純是還沒調完。這個反駁沒辦法被現有資料排除——官方沒解釋為什麼是這個順序。但一家公司選擇在發表日推出什麼、留下什麼,通常不是隨機的。

該盯的只有一個日期

這篇裡真正會改變你選擇的,是 FLUX 3 Dev 的開放權重什麼時候到、授權條款怎麼寫。FLUX.1 那一代的權重帶著非商用限制,商用得另外談授權;FLUX 3 Dev 會不會延續,官方一個字都沒說。

對創作工具的使用者,這波發表可以先放著——底層要換也不是這幾週的事。對真的要用影片生成的人,現在能做的是去申請早期測試,然後自己跑一輪對照,別直接用那三組偏好率當採購依據。對盯機器人的人,30 分鐘那個數字先記在旁邊,等第三方複現。

至於圖像模型什麼時候上——官方只說「未來幾週」。這家公司最出名的產品,這次連個日期都沒給。

SOURCES

  1. A FLUX 3(Black Forest Labs 官方公告)
  2. A Black Forest Labs Unveils FLUX 3, A New Multimodal Frontier Model For Visual Intelligence
  3. B Black Forest Labs Unveils FLUX 3 AI: Ditches Stills for Video—And Robot Hands
  4. B Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
  5. C FLUX 3 Multimodal(ComfyUI Wiki 條目)

來源分級:A = 一手公告/論文/官方文件 · B = 可信媒體 · C = 可參考但需脈絡 · D = 觀察用,不可當事實。

本文由 AI 協助研究與起草,矽基前沿編輯部編修,總編輯廖玄同審閱定稿。 編輯方針與 AI 使用說明

WEEKLY [SI]GNALS

訂閱《矽基前沿週報》

每週五早上,把本週 AI 與算力產業最值得記住的變化連回台灣。

本週關鍵訊號 · 為什麼值得記住 · 下週觀察 · 5 分鐘讀完。

免費 · 隨時取消 · 不轉售你的 email。

MACHINE-READABLE SUMMARY

Topic
AI 戰爭
Key claims
  • Black Forest Labs 於 2026-07-23 發表 FLUX 3,官方稱其把圖像、影片、聲音與動作預測放進同一套 Self-Flow 架構聯合訓練。
  • 今天開放早期測試的是 FLUX 3 Video 與 FLUX 3 Action;讓公司成名的 FLUX 3 Image 官方說「未來幾週」推出,開放權重的 FLUX 3 Dev 要等今年稍晚。
  • FLUX 3 Video 可從文字、圖片或既有影片生成最長 20 秒、帶原生同步聲音的片段。
  • 官方公布的人類偏好測試中,FLUX 3 Video 對 Runway Gen-4.5 的偏好率為 77%、對 Luma Ray 3.2 為 93%、對 Gemini Omni 與 Seedance 約 52%;這是 Black Forest Labs 自家做的偏好測試,官方並自稱結果為初步。
  • 動作預測線與瑞士機器人公司 mimic robotics 合作,成果名為 FLUX-mimic;官方稱部分任務只要約 30 分鐘機器人資料就能微調,先前方法需 30 小時以上。
  • Audi 正在測試 FLUX-mimic 做車門封條安裝這類工序,Decrypt 記載其反應時間約 101 毫秒;該測試為測試階段,非量產導入。
  • FLUX 3 的定價未公布,官方公告與新聞稿都只提到透過 API 與私有權重授權提供商業存取。
  • Black Forest Labs 成立於 2024 年,團隊約 100 人,估值 32.5 億美元,累計募資逾 4.5 億美元,投資人包含 a16z、Salesforce Ventures、NVIDIA、Adobe、Figma 與 Canva。
Entities
Black Forest Labs · FLUX 3 · FLUX 3 Video · FLUX 3 Image · FLUX 3 Action · FLUX 3 Dev · Self-Flow · FLUX-mimic · mimic robotics · Robin Rombach · Elvis Nava · Audi · Canva · Picsart · Runway Gen-4.5 · Luma Ray 3.2
Taiwan relevance
medium
Confidence
high
Last updated
2026-07-25
Canonical URL
https://signals.tw/articles/flux-3-video-action-first/

SUGGESTED CITATION

如果 AI agent / 研究 / 報導要引用本文,建議格式如下:

矽基前沿 · AI 戰爭線(編輯:廖玄同),《FLUX 3 先放影片和機器手,畫圖的排最後》,矽基前沿 [Si]gnals,2026-07-25。https://signals.tw/articles/flux-3-video-action-first/

AI agents / search engines may quote, summarize, and cite with attribution and a link back to the canonical URL above. See /for-ai-agents for full policy.