2026 年 7 月 23 日,柏林的 Black Forest Labs(BFL)扔下了一颗重磅炸弹——FLUX 3 正式亮相。这不是一次常规的版本迭代,而是一次彻底的范式跃迁。从最初只擅长文生图的 FLUX.1,到如今能同时驾驭图像、视频、音频乃至动作预测的全能型选手,BFL 用三年时间完成了一场从"单模态工匠"到"多模态架构师"的蜕变。

FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone  of Visual Intelligence. | Black Forest Labs

从像素工厂到世界模型:FLUX 3 到底是什么

如果你还在把 FLUX 3 简单归类为"又一个 AI 画图工具"那格局就小了。BFL 官方给它的定位非常明确:这是一个基于单一网络架构的多模态基础模型。什么意思?过去你想做图得找 Stable Diffusion,想做视频得切到 Sora,想配个音又得换一套系统。FLUX 3 的思路是——一个主干网络,通吃所有模态。

这种"全能模型"(Omni-Model)路线,目前全球跑在前面的也就 OpenAI、Google DeepMind 和字节跳动寥寥几家。BFL 选择这条赛道,底气来自他们自 2024 年起就在视频生成领域的持续投入。早在当年 8 月,BFL 官网就曾短暂上线过一个视频模型的预告页,业内观察者 Andrew Curran 当时就敏锐地捕捉到了信号。两年后的今天,这些技术储备终于以 FLUX 3 的形态全面释放。

The Rise of Multi-Modal AI: How Text, Images, and Audio Come Together |  Medium

技术内核:一个网络如何同时"看见"和"听见"

FLUX 3 的技术哲学可以浓缩成 BFL 发布时的那句标语——"在控制、真实感和世界理解方面取得突破"。拆解来看,这里面藏着三个关键维度。

世界理解(World Understanding)是其中最野心勃勃的部分BFL 不再满足于让模型学会"像素怎么排",而是试图让它理解"物理世界怎么运转"。这种表述听起来更像 DeepMind 或 NVIDIA 的世界模型叙事,而非传统图像生成厂商的语言。它意味着 FLUX 3 生成的视频不只是画面好看,物体运动、光影变化、材质交互都要符合真实物理规律。

多模态统一输出则是架构层面的核心创新。从 BFL 官方放出的技术架构图可以清晰看到,文本、图像、视频、音频四条信息流先经过各自的编码器,然后汇入一个共享的多模态 Transformer 主干,最后再由不同的解码器分发到对应输出端。这种设计的好处显而易见:不同模态之间可以共享语义理解文本提示能更精准地"翻译"成画面和声音,图像参考也能无缝迁移到视频生成中。

Unlocking the Power of Multimodal AI: Jieyue Xingchen's Step-Video-TI2V  Model Revolutionizes Image-to-Video Generation - ComfyUI.org

动作预测可能是 FLUX 3 最出人意料的能力。BFL 把这套主干网络开放给了机器人领域,首发合作伙伴 Mimic Robotics 已经在奥迪产线上进行了实测。据他们反馈基于 FLUX 3 骨干的视频动作模型在灵巧操作任务中,样本效率相比传统视觉-语言-动作模型有了显著提升。这意味着 FLUX 3 的"世界理解"不只是停留在屏幕里,它正在走进工厂和实验室。

FLUX 3 x mimic: The Next Generation of Video-Action Models | Black Forest  Labs

视频生成:FLUX 3 当下的王牌能力

虽然 FLUX 3 理论上四模态全能,但目前真正开放抢先体验的是视频功能,而且规格相当能打。单条生成最长可达 20 秒,更关键的是原生支持音频同步输出——对话、环境音效、背景音乐都能随画面一起生成,不用再后期配音。

具体玩法上,BFL 给得很足。文本转视频、图像转视频、视频转视频这三板斧是基础操作,进阶玩家还能玩关键帧控制、多镜头智能剪辑、视频和音频的向前扩展风格方面也不设限,从写实到动画,从横屏电影比例到竖屏短视频比例,基本覆盖了当前内容创作的主流场景。

早期测试者已经放出了不少令人惊艳的样片。Mark Kleschumann 那段 20 秒的哥斯拉视频因为音画同步过于逼真而在社区疯传,Umesh 制作的拉力赛车连续镜头也因为运镜专业、物理合理而被大量转发。Reddit 的 r/StableDiffusion 板块里,关于 FLUX 3 视频生成的讨论帖热度持续走高,不少用户提到它的物理模拟和电影级运镜能力确实超出了预期。

FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone  of Visual Intelligence. | Black Forest Labs

竞争格局:FLUX 3 站在什么位置

把 FLUX 3 放到当下的 AI 生成赛道里看,它的对手个个来头不小。字节跳动的 Seedance 2.5、快手的 Kling、Google 的 Veo 3.1、OpenAI 的 Sora,都是视频生成领域的狠角色。但 FLUX 3 的差异化在于"多模态完整性"——它是目前少数几个在发布时就明确覆盖图像、视频、音频、动作四大模态的模型,而不是一个视频模型后期硬凑音频功能。

从 BFL 自己公布的早期盲测数据来看,FLUX 3 在多个维度上表现强势。在对阵 Luma Ray 3.2 时用户偏好率高达 93%;面对 Runway Gen-4.5 也有 77% 的胜率;即便是和 Kling v3 Pro、Grok Imagine Video 这类一线产品对比,FLUX 3 依然保持了明显的领先身位。当然,这只是 BFL 的内部初步评估,真正的独立第三方基准测试还需要等待社区和学术机构的进一步验证。

怎么用上 FLUX 3:现状与时间表

FLUX 3 的 rollout 是分阶段推进的。截至 2026 年 7 月 24 日,视频抢先体验已经通过 bfl.ai/models/flux-3 开放申请,获批用户可以直接上手。图像生成的抢先体验窗口 BFL 承诺会在"未来几周内"打开API 接口和定价方案也在同一时间段内公布。

对于开源社区来说,好消息是 BFL 已经确认会发布 FLUX 3 Dev 的开放权重版本,延续 FLUX.1 和 FLUX.2 时代"商业版 + 开源版"的双轨策略。不过具体的发布时间、许可条款(预计仍是非商业开放权重而非完全开源)以及模型规模都还没公布。如果你现在就想在本地跑起来,可能还得再等等。

需要特别提醒的是,BFL 的权威信息渠道只有 bfl.ai 官网和 @bfl_ai 官方账号,CEO Robin Rombach 的个人账号 @robrombach 也会同步关键进展。市面上任何打着 "flux-3.com" 旗号的第三方网站都与 Black Forest Labs 无关,申请访问时务必认准官方入口。

那些还没揭晓的悬念

即便已经正式发布,FLUX 3 身上依然挂着不少问号。原生视频分辨率到底是多少?最大帧率能到多少?音频同步的延迟和采样率参数如何这些底层规格 BFL 目前都没有完整披露。参数总量和推理所需的硬件配置也是未知数——如果开放权重版本对显存要求过于苛刻,那本地部署的门槛就会很高。

定价策略更是整个行业都在盯着看的焦点。BFL 过往产品的定价一直以"高性价比"著称,但在视频生成这个烧算力的赛道里,FLUX 3 的 API 定价是否还能延续这一传统,将直接影响它在专业创作者和小团队中的渗透率。

What is Multimodal AI? | dida ML Basics

写在最后:FLUX 3 的真正价值

回头看,FLUX 3 的意义可能不止于"又出了一个很强的 AI 视频工具"。它代表了一种趋势——生成式 AI 正在从"工具集合"走向"统一智能"。当同一个神经网络既能画出海报、又能剪出短片、还能给机器人下达动作指令时,我们离真正的通用视觉智能就更近了一步。

对于创作者而言FLUX 3 视频功能的开放意味着高质量 AI 视频生成的门槛正在进一步降低。对于开发者和研究者来说,即将开源的 FLUX 3 Dev 骨干网络则提供了一个窥探多模态统一架构的绝佳机会。至于它最终能不能在 Seedance、Veo、Kling 的围剿中杀出重围,答案不取决于发布会的 PPT,而取决于接下来几个月里,真实用户用它产出的内容够不够惊艳、API 定价够不够友好、开源版本够不够好用。

这三张牌怎么打,将决定 FLUX 3 是成为多模态 AI 时代的标杆,还是又一个"发布即巅峰"的遗憾案例至少从现在的牌面来看,BFL 手里的筹码,足够让人期待。

更多推荐