Black Forest Labs

FLUX 3 — 真实世界模型

Black Forest Labs 的全新多模态基础模型在统一架构中联合学习图像、视频与音频——因为视觉智能需要理解物体如何保持完整、事物如何运动,以及事件如何发声。

FLUX 3 基于 Self-Flow 构建——在同一架构中高效对齐多模态生成与理解——并同步扩展至视频、图像与音频。

Flux 3 AI

0/10

拖拽或点击上传最多 10 张 JPG、PNG 或 WEBP 参考图

0 / 5000

所需积分:6030

Sample Image

(生成的图像结果将显示在此处)

Sample result

FLUX 3 基于 Self-Flow 构建——在同一架构中高效对齐多模态生成与理解——并同步扩展至视频、图像与音频。

FLUX 3 如何改变多模态生成

一个模型,一个底层现实

图像、视频与音频是同一世界在不同传感器下的投影。FLUX 3 同时从三者中学习,使声音匹配冲击、运动遵循质量,未来从过去自然延续。

Self-Flow 架构

Self-Flow 架构

基于 Self-Flow,BFL 大幅扩展算力与数据,在同一底层模型中训练生成与理解——提升质量与下游任务表现。

自由混合模态

FLUX 3 可从文字提示词联合生成图像与带音频的视频,也可组合图像、视频等参考输入,将角色、风格与上下文带入新场景。

迈向视觉智能

迈向视觉智能

FLUX 3 是 BFL 发展真实世界视觉智能使命的里程碑:在物理与数字环境中感知、预测与行动的模型。

Black Forest Labs 将分阶段推出 FLUX 3 能力——均基于同一多模态流匹配模型,并通过抢先体验收集反馈与进行安全测试。

FLUX 3 发布计划

FLUX 3 为创作者、营销人员、设计师、机器人团队,以及任何需要智能创意伙伴而非单一模态转换工具的人而打造。

FLUX 3 适合谁

创作者与电影制作人

生成带原生音频、多语言对白与风格多样性的电影级片段——从手持摄像风格到动画。将片段串联为更长多镜头序列,保持角色一致。

营销与视觉团队

产出 campaign 概念、精修变体与重排版设计。以参考图 grounding 生成结果,在图像与视频工作流中更快迭代。

物理 AI 与机器人

物理 AI 与机器人

利用 FLUX 3 的世界理解进行动作预测。FLUX-mimic 以有限任务数据微调视频骨干,实现灵巧操作——连接内容创作与物理 AI。

视觉智能的下一个骨干

从交互式图像与视频编辑,到仿真、计算机使用与物理 AI——FLUX 3 开启广阔前沿。视频生成现已开放抢先体验。

统一模型驱动视频、图像与动作——各模态共享在图像、视频与音频上训练的世界理解。

FLUX 3 能力

带原生音频的视频(最长 20 秒)

文字生成视频、图生视频动画、视频参考迁移、生成式音视频续写与关键帧到视频控制——均含同步原生音频生成。

多语言对白与声音设计

擅长捕捉人类面部表情、将声音与物理事件关联,并生成多语言对白——可组合为持续数分钟的序列。

风格多样性与排版

覆盖手持摄像风格到动画与电影感。在广泛视觉风格与宽高比下实现强排版与动画设计能力。

智能多镜头串联

将单个片段串联为更长多镜头序列。视觉参考帮助确保角色在 extended 叙事中保持全程一致。

图像合成与编辑

以多样风格、宽高比与分辨率合成和编辑图像。复杂提示词遵循与多语言高精度文字渲染显著提升。

动作预测

FLUX 3 原生集成动作预测,并有 FLUX-mimic 等微调专用模型——以预训练视频骨干作为动力学感知基础。

早期基准表现

在初步 720p 文字生成视频评估中,FLUX 3 在多项 head-to-head 对比中优于若干领先模型——抢先体验阶段仍有进一步提升空间。

关于 FLUX 3 的常见问题

本页汇总 Black Forest Labs 公开发布的 FLUX 3 信息,我们与 BFL 无隶属关系。