黑森林實驗室釋出FLUX 3:一個模型搞定影片、音訊和機器人

多模態AI從拼接走向統一

2026-07-27 10:49
FLUX 3多模態模型介面
FLUX 3多模態模型介面

生成式AI領域又迎來一個重量級選手。

7月23日,黑森林實驗室正式釋出FLUX 3多模態基礎模型。這可不是FLUX系列的簡單升級——它是這套模型家族第一次從純影象生成,跨進了影片、音訊和機器人動作預測的統一世界。

FLUX 3最核心的突破在於它的架構。它不再像過去那樣為影象、影片、音訊分別訓練不同的模型再拼到一起,而是基於自研的Self-Flow架構,在同一套引數空間裡同時學習三大模態。說白了,模型同時看影象學結構、看影片學運動、聽音訊學聲音的因果關聯——這些資訊在訓練過程中互相約束,最終生成出來的內容不會出現「物體撞了卻沒聲音」這種違和感。

能力方面,FLUX 3可以單次生成最長20秒的720p影片,並且自帶原生音訊——對話、音效、背景音樂全部統一生成,不需要後期合成。它還支援文生影片、圖生影片、影片續寫、關鍵幀轉影片和多鏡頭串聯。在10秒有聲影片的人工評測裡,FLUX 3對比Grok Imagine Video勝率69%,對比Seedance 2.0勝率52%,對比Gemini Omni Flash勝率同樣達到52%。多模態能力已不輸甚至領先於當前主流的影片生成產品。

但比影片能力更值得關注的是機器人方向。黑森林實驗室與Mimic Robotics合作推出了FLUX-mimic,把FLUX 3的影片預測能力延伸到物理世界——模型不僅能預測影片中下一幀的畫面,還能預測一個機械動作的物理結果。目前在奧迪工廠的測試中,機器人只需30分鐘的真實運算元據就能學會一項新的精密操控任務,而傳統方法需要30小時以上。這60倍的效率差距,意味著具身智慧的訓練成本可能被大幅拉低。

影象方面,FLUX 3延續了FLUX家族的強項——支援多種風格、寬高比和解析度的生成與編輯。從FLUX.1到FLUX.2再到今天的FLUX 3,這條迭代路線從一個純粹的影象生成工具,一步一步變成了能理解影象、影片、聲音和物理運動的多模態引擎。

從商業角度看,黑森林實驗室目前的估值已達32.5億美元,投資者包括Andreessen Horowitz等頂級風投。FLUX 3的Dev版本後續會開源——這對整個開源AI社群來說是個不小的禮物。

多模態AI正在從「分別訓練再拼湊」走向「一個模型理解整個世界」——FLUX 3是這個方向目前走得最遠的產品之一。