创作者与电影制作人
生成带原生音频、多语言对白与风格多样性的电影级片段——从手持摄像风格到动画。将片段串联为更长多镜头序列,保持角色一致。
拖拽或点击上传最多 10 张 JPG、PNG 或 WEBP 参考图
0 / 5000
Sample Image
(生成的图像结果将显示在此处)

FLUX 3 基于 Self-Flow 构建——在同一架构中高效对齐多模态生成与理解——并同步扩展至视频、图像与音频。
图像、视频与音频是同一世界在不同传感器下的投影。FLUX 3 同时从三者中学习,使声音匹配冲击、运动遵循质量,未来从过去自然延续。

基于 Self-Flow,BFL 大幅扩展算力与数据,在同一底层模型中训练生成与理解——提升质量与下游任务表现。
FLUX 3 可从文字提示词联合生成图像与带音频的视频,也可组合图像、视频等参考输入,将角色、风格与上下文带入新场景。

FLUX 3 是 BFL 发展真实世界视觉智能使命的里程碑:在物理与数字环境中感知、预测与行动的模型。
FLUX 3 为创作者、营销人员、设计师、机器人团队,以及任何需要智能创意伙伴而非单一模态转换工具的人而打造。
生成带原生音频、多语言对白与风格多样性的电影级片段——从手持摄像风格到动画。将片段串联为更长多镜头序列,保持角色一致。
产出 campaign 概念、精修变体与重排版设计。以参考图 grounding 生成结果,在图像与视频工作流中更快迭代。

利用 FLUX 3 的世界理解进行动作预测。FLUX-mimic 以有限任务数据微调视频骨干,实现灵巧操作——连接内容创作与物理 AI。
统一模型驱动视频、图像与动作——各模态共享在图像、视频与音频上训练的世界理解。
文字生成视频、图生视频动画、视频参考迁移、生成式音视频续写与关键帧到视频控制——均含同步原生音频生成。
擅长捕捉人类面部表情、将声音与物理事件关联,并生成多语言对白——可组合为持续数分钟的序列。
覆盖手持摄像风格到动画与电影感。在广泛视觉风格与宽高比下实现强排版与动画设计能力。
将单个片段串联为更长多镜头序列。视觉参考帮助确保角色在 extended 叙事中保持全程一致。
以多样风格、宽高比与分辨率合成和编辑图像。复杂提示词遵循与多语言高精度文字渲染显著提升。
FLUX 3 原生集成动作预测,并有 FLUX-mimic 等微调专用模型——以预训练视频骨干作为动力学感知基础。
在初步 720p 文字生成视频评估中,FLUX 3 在多项 head-to-head 对比中优于若干领先模型——抢先体验阶段仍有进一步提升空间。
探索 Black Forest Labs 的 FLUX 3,并在我们的平台开始创作。
本页汇总 Black Forest Labs 公开发布的 FLUX 3 信息,我们与 BFL 无隶属关系。