「只学图像的模型,只会生成图像」——Rombach 用 FLUX 3 押上的那个赌注

2026-07-26 · AI观点雷达 · 多模态 · 生成模型 · 计算摄影 · 世界模型
把图像、视频、音频、动作放进一个架构联合训练,是一个值得跟踪的科学赌注——但目前它被当成已经成立的结论在说,而支撑它的消融实验一个都没公开。

先说结论

7 月 23 日,Black Forest Labs 发布 FLUX 3,同时抛出一句很硬的话:「你没法糊弄现实。一个只学图像的模型,就只会生成图像。」(“You can’t cheat reality. A model that only learns images can only generate images.")说这话的是 CEO Robin Rombach——Stable Diffusion 的作者之一,做图像生成起家的人。

这句话背后是一个明确的技术判断:图像、视频、音频、动作不是四件事,而是同一个现实经不同传感器的四种投影,所以应该在一个架构里联合训练。这是个漂亮的、可证伪的科学命题。我的评价是:命题值得长期跟踪,但发布材料里它是以「结论」的语气说的,而能证明它的证据一个都没给。

事情是怎么发生的

BFL 这篇博客的标题本身就在表态:FLUX 3 — Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence。他们不再自称图像生成公司,而是「视觉智能的基础层」。

技术口径上,FLUX 3 建立在他们叫 Self-Flow 的方法上——在同一个底层架构里对齐多模态的生成与理解——然后把视频、图像、音频一起大规模扩训。博客里那句核心表述是:联合训练之后,「这些模态不再是彼此分离的,而开始成为关于同一个底层现实的证据」。

产品面:目前只有 FLUX 3 Video 进了早期访问,图像生成(BFL 真正的看家本领)、FLUX-mimic、以及开放权重的 FLUX 3 Dev 都还是「coming soon」。机器人那条线是和苏黎世的 mimic robotics 合作的 FLUX-mimic,宣称针对一个操作任务微调只要 30 分钟机器人数据,而以往方法要 30 小时以上;奥迪的 Production Lab 正在产线上测软体件操作。

为什么重要

它把一个长期争论逼到了具体位置上。过去两年,「像素生成算不算理解世界」一直是隔空对喊:一边说扩散模型只是在拟合数据分布,一边说生成就是最好的压缩与理解。FLUX 3 是第一次由最纯粹的像素生成阵营给出正面回答——不是辩解「我们其实懂物理」,而是直接说:所以我们把动作也一起训了。

对做影像的人还有一层更实际的意义:如果这条路真的走通,未来影像系统的底座就不再是「一个专门的图像模型」,而是一个跨模态的通用视觉主干,图像只是它的一个输出头。这会改变整条链路的设计假设。

我的正反评价

支持的一面。 这个 framing 是对的。多模态不该被理解成「拼几个专家模型」,而应该是同一物理过程的多路观测——这在色彩科学里我们其实很熟悉:光谱、三刺激值、RGB 响应本来就是同一辐射量经不同采样得到的投影。BFL 这句「different sensors, same reality」在物理直觉上站得住。另外,30 分钟 vs 30 小时那个数量级差,如果能被第三方复现,是这次发布里最有分量的实证信号——它才是「联合训练带来迁移」的真正证据形态。

质疑的一面,而且是主要的。 「每个模态互相强化」被当成架构选择的理由说出来,但发布材料里没有任何东西在检验它。要支持这个说法,需要的是消融:同样的数据预算、同样的算力,单模态训练 vs 联合训练,逐项对比。一个都没有。

benchmark 也经不起细看:93% 胜 Luma Ray 3.2、77% 胜 Runway Gen-4.5、69% 胜 Grok Imagine Video——赢的都是弱一档的对手;到了 Seedance 2.0 和 Gemini Omni Flash,52%,也就是抛硬币。而且全部是自评、自选对手、自选提示词,BFL 自己都标注「结果是初步的」。同时,图像生成没发,开放权重推到年内待定。

所以更准确的描述是:一个赌注,被用发现的语气讲了出来。 这不丢人——这是个大赌注,Rombach 有资格下——但读的人要自己把语气调回去。顺带一提,三周前李飞飞刚划过一条线:只会产像素的不算世界模型。FLUX 3 与其说是反驳,不如说是接受了这个判定标准,然后宣布自己要去满足它。判定还没做。

对研究、教学和影像系统的启发

第一,别把这类主干直接往 ISP 里放。 一个用「人类偏好胜率」当尺子训练和评测的视觉基础层,优化的是观感讨喜,不是辐射度与色度上的正确。这两者在很多场景是冲突的。要用它做增强可以,但白平衡、CCM、色彩还原这类需要可测、可复现、可审计误差的环节,评价指标必须自带——ΔE、光谱重建误差、跨光源一致性——不能用 preference rate 替代。

第二,这是给学生讲「主张 vs 证据」的好材料。 同一篇发布里,有物理直觉很强的命题,有自评的胜率表,有一句 52%。让他们自己找出哪句是可证伪的、要什么实验才能证伪、以及为什么 93% 那一栏比 52% 那一栏信息量更小。

第三,放进雷达跟三件可证伪的事: ①BFL 会不会公开联合训练 vs 单模态的消融;②FLUX 3 Dev 的开放权重最终给不给、给什么许可和参数量;③奥迪那条线是停在「测试」,还是真的进了生产节拍。这三件里但凡有两件落空,今天这句「只学图像的模型只会生成图像」就该被降级成一句公司口号。