黑森林實驗室

FLUX 3 — 真實世界模型

黑森林實驗室的新多模態基礎模型在統一架構中共同學習圖像、視頻和音頻,因為視覺智能需要了解物體如何結合在一起、物體如何移動以及事件如何發聲。

使用 FLUX 3 創建

一處產生影像和影片 - 無需離開主頁即可切換模式。

0 / 5000

所需學分:50

Sample Image

(已建立的圖像結果將顯示在此)

Sample result

FLUX 3 基於 Self-Flow 構建——在同一架構內有效地協調多模式生成和理解——同時跨視訊、影像和音訊進行擴展。

為什麼 FLUX 3 改變了多模式生成

一種模型,一種基本現實

影像、視訊和音訊是不同感測器捕捉的同一世界的投影。 FLUX 3 同時學習所有這些,因此聲音與衝擊相匹配,運動服從質量,未來跟隨過去。

自流架構

自流架構

基於自流,BFL 顯著擴展了計算和數據,以在同一底層模型中訓練生成和理解,從而提高品質和下游任務性能。

自由組合方式

FLUX 3 可以根據文字提示產生帶有音頻的圖像和視頻,或者組合圖像和視頻剪輯等輸入參考,將角色、風格和上下文帶入新場景。

邁向視覺智能

邁向視覺智能

FLUX 3 是 BFL 開發現實世界視覺智慧使命的一個檢視點:在物理和數位環境中感知、預測和行動的模型。

Black Forest Labs 正在分階段推出 FLUX 3 功能 - 每個功能均基於相同的底層多模式流量匹配模型構建,可儘早獲得回饋和安全測試。

FLUX 3 上線計劃

FLUX 3 專為創作者、行銷人員、設計師、機器人團隊以及任何想要智慧創意合作夥伴(而不僅僅是單一模式轉換器)的人而打造。

FLUX 3 適合誰

創作者和電影製作人

產生具有原生音訊、多語言對話和風格多樣性的影片剪輯 - 從偷拍的攝影機鏡頭到動畫。將剪輯連結成具有一致角色的較長多鏡頭序列。

行銷人員和視覺團隊

透過代理推理製作活動概念、精美變體和大量版式設計。參考文獻中的幾代人並在圖像和視訊工作流程中更快地迭代。

物理人工智慧和機器人技術

物理人工智慧和機器人技術

使用 FLUX 3 的世界理解進行動作預測。 FLUX-mimic 透過有限的特定任務資料對視訊主幹進行微調,以實現靈巧的操作—橋接內容創建和實體人工智慧。

視覺智慧的下一個支柱

從互動式影像和影片編輯到模擬、電腦使用和實體人工智慧——FLUX 3 開闢了廣闊的前沿。影片生成現已開放搶先體驗。

一個統一的模型為視訊、圖像和動作提供動力——每種模式都受益於跨圖像、視訊和音訊訓練的共享世界理解。

FLUX 3 功能

附有原生音訊的影片(最長 20 秒)

文字到視訊、圖像到視訊動畫、視訊到視訊參考傳輸、生成視訊音訊延續以及關鍵影格到視訊控制 - 所有這些都具有同步的本機音訊生成。

多語言對話與聲音設計

擅長捕捉人類面部表情、將聲音與物理事件相關聯以及生成多語言對話 - 將功能組合成持續幾分鐘的序列。

風格多樣性和版式

處理範圍從偷拍的攝影機鏡頭到動畫和電影。強大的版式生成和動畫設計,涵蓋各種視覺風格和縱橫比。

代理多鏡頭鏈接

將單一剪輯連結成更長的多鏡頭序列。視覺參考有助於確保角色在整個敘事過程中的所有場景中保持一致。

影像合成與編輯

合成和編輯各種樣式、長寬比和解析度的圖像。改進了複雜的提示依從性和多種語言的高精度文字呈現。

動作預測

原生動作預測直接整合到 FLUX 3 中,加上經過微調的專用模型(如 FLUX-mimic)—使用預先訓練的視訊主幹作為動態感知基礎。

早期基準性能

在初步的 720p 文字轉視訊評估中,FLUX 3 在頭對頭比較中優於幾個領先的模型 - 預計在早期訪問期間會有進一步的改進。

了解有關多模式 AI 的更多信息

探索 Black Forest Labs 的 FLUX 3 並開始使用我們的平台進行創作。

有關 FLUX 3 的常見問題

本頁面總結了 Black Forest Labs 提供的有關 FLUX 3 的公開資訊。我們不隸屬於 BFL。