黒い森の研究所

FLUX 3 — 現実世界のモデル

Black Forest Labs の新しいマルチモーダル基盤モデルは、統一されたアーキテクチャ内で画像、ビデオ、オーディオから共同学習します。視覚的知性には、物体がどのように結合するか、物体がどのように動くか、イベントがどのように聞こえるかを理解する必要があるためです。

FLUX 3 で作成する

画像とビデオを 1 か所で生成 — ホームページから離れることなくモードを切り替えます。

0 / 5000

必要なクレジット:50

Sample Image

(作成した画像の結果がここに表示されます)

Sample result

FLUX 3 はセルフフローに基づいて構築されており、同じアーキテクチャ内でマルチモーダルな生成と理解を効率的に調整し、ビデオ、画像、オーディオを同時にスケーリングします。

FLUX 3 がマルチモーダル生成を変える理由

1 つのモデル、1 つの基礎となる現実

画像、ビデオ、オーディオは、異なるセンサーによってキャプチャされた同じ世界の投影です。 FLUX 3 はそれらすべてから一度に学習するため、サウンドは衝撃に一致し、動きは質量に従い、未来は過去から続きます。

セルフフローアーキテクチャ

セルフフローアーキテクチャ

Self-Flow に基づいて、BFL はコンピューティングとデータを大幅にスケールし、同じ基礎となるモデルで生成と理解をトレーニングし、品質と下流タスクのパフォーマンスの両方を向上させました。

モダリティを自由に組み合わせる

FLUX 3 は、テキスト プロンプトから音声付きの画像とビデオを共同生成したり、画像やビデオ クリップなどの入力参照を組み合わせて文字、スタイル、コンテキストを新しいシーンに組み込むことができます。

視覚的知性を目指して

視覚的知性を目指して

FLUX 3 は、現実世界のビジュアル インテリジェンス、つまり物理環境とデジタル環境全体で認識、予測、動作するモデルを開発するという BFL の使命のチェックポイントです。

Black Forest Labs は、FLUX 3 機能を段階的に展開しています。それぞれの機能は、同じ基盤となるマルチモーダル フロー マッチング モデルから構築されており、フィードバックと安全性テストのための早期アクセスが可能です。

FLUX 3 発売計画

FLUX 3 は、クリエイター、マーケティング担当者、デザイナー、ロボット工学チーム、そして単なる単一モダリティのコンバーターではなく、インテリジェントなクリエイティブ パートナーを求めるすべての人向けに構築されています。

FLUX 3 は誰に向いているのか

クリエイターと映画制作者

ビデオカメラの率直な映像からアニメーションまで、ネイティブ オーディオ、多言語の対話、スタイルの多様性を備えた映画のようなクリップを生成します。一貫したキャラクターを持つ長いマルチショット シーケンスにクリップをチェーンします。

マーケターとビジュアルチーム

エージェントの推論を使用して、キャンペーンのコンセプト、洗練されたバリエーション、タイポグラフィーを多用したデザインを作成します。参照内のグラウンド生成と、画像とビデオのワークフロー全体での反復処理が高速化されます。

物理AIとロボティクス

物理AIとロボティクス

FLUX 3 の世界理解をアクション予測に使用します。 FLUX-mimic は、限られたタスク固有のデータを使用して巧みに操作できるようにビデオ バックボーンを微調整し、コンテンツ作成と物理 AI の橋渡しをします。

視覚的知性の次のバックボーン

インタラクティブな画像やビデオの編集から、シミュレーション、コンピューターの使用、物理 AI まで、FLUX 3 は幅広いフロンティアを開きます。ビデオ生成は現在早期アクセスで利用できます。

1 つの統合モデルがビデオ、画像、アクションを強化します。各モダリティは、画像、ビデオ、オーディオにわたって訓練された共有世界の理解を活用します。

FLUX 3 の機能

ネイティブオーディオ付きビデオ (最大 20 秒)

テキストからビデオへ、画像からビデオへのアニメーション、ビデオからビデオへのリファレンス転送、生成的なビデオとオーディオの継続、およびキーフレームからビデオへの制御 - すべてが同期されたネイティブ オーディオ生成によって行われます。

多言語対話とサウンドデザイン

人間の表情のキャプチャ、音と物理的出来事の関連付け、多言語対話の生成に優れており、機能を組み合わせて数分間のシーケンスを作成します。

スタイルの多様性とタイポグラフィー

ビデオカメラの率直な映像からアニメーションや映画まで幅広く扱います。幅広いビジュアルスタイルとアスペクト比にわたる強力なタイポグラフィー生成とアニメーションデザイン。

エージェントによるマルチショット チェーン

個々のクリップをより長いマルチショット シーケンスにチェーンします。視覚的な参照は、拡張された物語全体のすべてのシーンでキャラクターの一貫性を保つのに役立ちます。

画像の合成・編集

さまざまなスタイル、アスペクト比、解像度で画像を合成および編集します。複雑なプロンプト遵守と複数言語での高精度のテキスト レンダリングが改善されました。

行動予測

FLUX 3 に直接統合されたネイティブ アクション予測に加え、ダイナミクスを意識した基盤として事前トレーニングされたビデオ バックボーンを使用して、FLUX-mimic のような微調整された特殊なモデルを追加します。

初期のベンチマーク パフォーマンス

720p のテキストからビデオへの予備評価では、直接比較した場合、FLUX 3 がいくつかの主要モデルよりも好まれ、早期アクセス中にさらなる改善が期待されました。

FLUX 3 に関するよくある質問

このページには、Black Forest Labs から FLUX 3 について公開されている情報がまとめられています。当社はBFLとは提携しておりません。