看不见的那部分:多模态模型的瓶颈,卡在「视觉压不进语言」这一步

2026-07-27 · AI观点雷达 · 多模态 · 视觉感知 · 评测 · ISP
多模态模型今天最硬的短板不是不会推理,而是抗语言化的视觉信息在压成 token 的那一步就丢了。

先说结论

今天不追当日热点,讲一条我认为值得长期挂在雷达上的判断:多模态大模型当前最硬的短板,不是「不会想」,而是「看到的东西压不进语言」

提出这条判断的是 BabyVision 这份工作(Liang Chen 等,arXiv:2601.06521,今年 1 月 10 日首发、7 月 7 日修订,同时是 ICML 2026 的 poster)。它不是又一份「模型很笨」的榜单,它给出的诊断有具体机制:视觉里那些天然抗语言化的部分——连续形状、曲线的同一性、三维空间变换——在被转写成 token 的那一刻就损失掉了,模型后面再聪明,也只是在一份有损的文字描述上推理。

事情是怎么发生的

BabyVision 的设定很刁钻:只考「语言之前」的视觉能力。388 道题、22 个子类、四个大类——精细辨别、视觉追踪、空间感知、视觉模式识别。题目刻意写得极短,就是不给模型用语言先验抄近路的机会。人类基线里放了成人,也放了 3 岁和 6 岁的孩子。

结果是:表现最好的 Gemini3-Pro-Preview 拿 49.7 分,成人平均 94.1 分,而且它落后于 6 岁儿童。论文摘要里那句话写得很直白——当代多模态大模型「仍然严重依赖语言先验来补偿其脆弱的视觉理解」。

作者把失败拆成四种:把连续形状离散化成有损的语言 token;把一维流形映射成离散指令序列,于是跟丢曲线的同一性;用概率性的文本生成去替代符合物理的渲染;以及把「风格」和「结构」混为一谈。串起来是一句话:无法被忠实表达为语言的视觉信息,就丢了

为什么重要

因为这跟主流叙事正面顶上了。

现在很多团队的赌注是反过来的:智能的天花板由文本推理决定,视觉是外围。GLM-5.2 就是这个逻辑的产物——纯文本,长程 agentic coding 榜单上很能打,但看不了图。有意思的是 6 月 29 日 Z.ai 那次开发者征询,几十万次浏览、三千多条回复,压倒性的答案是同一个词:vision。要截图、要 PDF、要读报错。

所以这是一场有名有姓、有时间戳的双边下注:一边押「文本推理抬上限」,一边是用户在真实工作流里被「模型看不清」卡住。BabyVision 提供的是这场赌局的第三方证据,而且它指的不是「视觉模块参数不够」,而是视觉与语言之间的那个接口本身是有损的。这个说法比「多模态还不够强」要具体得多,也更难靠堆数据糊过去。

我的正反评价

正面:机制说得清、可证伪。它不满足于报一个 gap,而是把 gap 归因到表征损失,还顺手做了 BabyVision-Gen——既然很多题的自然解法是「画出来」而不是「说出来」,那就让模型用生成来作答。这个动作本身就是论点的一部分。

反面,我保留三点。第一,388 题的规模不足以支撑「基础视觉原语缺失」这么大的结论,题目设计再巧,也可能只是刻画了某一类几何谜题;儿童基线的样本量与实施细节,值得投稿评审死磕。第二,「拿 6 岁小孩当尺子」的修辞很有传播力,但人和模型的能力剖面本来就不是同一条曲线,跨物种比分容易被过度解读。第三,也是最关键的——「压成语言就丢了」是一个诊断,不是一个方案。真按这个诊断走,就得有不经过语言瓶颈的视觉工作记忆,这在架构上是个未解问题,不是加个 encoder 能了事的。

对研究、教学和影像系统的启发

对我自己这条线,这个 framing 直接有用。颜色和光谱恰恰是最典型的「抗语言化」信息:两条不同光谱在某个观察者下同色异谱,这个差别在语言里根本没有词汇把手,你要模型「描述」它,它只能给你一个模糊的色名。同理,ISP 输出里的色偏、局部色相漂移、噪声结构——凡是需要连续量而非类别标签的缺陷,「让 VLM 描述这张图」这类评测天然测不到。要测,就得逼模型给出连续输出或者定位标注,而不是让它说话。

教学上我打算这么用:把 BabyVision 里那几道追踪曲线、心算三维旋转的题当课堂开场,让学生自己做一遍,再看模型的答案。比讲十遍「多模态模型有局限」有效。

要长期跟踪的观测点也很清楚:如果下一代模型在 BabyVision 这类抗语言化任务上仍然不动,而在知识密集型榜单上继续涨,那就说明瓶颈确实在接口,不在规模——这条曲线的分叉,比任何一次发布会都更能说明问题。