把「会看」和「会画」装进同一个模型,是这两年影像 AI 最热的合体方向,理由听起来很美:学过画图的模型对画面细节的把握更细,看图也更准。GAS 这篇论文有意思的地方,是它把「生成」从一项产品功能降级成了训练期的陪练——只在训练时在场,部署时整个撤走,看图能力照样涨,模型一个字节都没变大。
先说现在大家是怎么做的。看图大模型(把图像压成一串特征向量、再交给大语言模型去推理的模型,也就是 VLM)正纷纷和画图模型合并成所谓「统一多模态模型」:一个模型既能回答「图里有几把椅子」,也能按文字画图。行业默认这套合体是互利的——生成任务逼着网络记住更多画面信息,反过来喂饱理解。麻烦在于「互利」从来没白来过:生成要「画得像」,理解要「答得对」,两套目标在同一条网络里共用全部参数,梯度互相拉扯。论文自己做了对照实验,把生成监督直接混进训练,综合成绩从 47.25 掉到 46.00。换句话说,「会画帮会看」眼下更像一笔亏本买卖。
GAS 的解法分三步,每一步都在拆掉亏损的来源。第一步,不让模型真画像素:它的「生成」被改写到特征空间——模型眼里的画面本来就是一串向量,训练目标是让它像文字接龙那样,按顺序预测出目标图像对应的那串向量,不需要像素解码器,也不需要把图切成离散积木的 tokenizer;监督目标由一个随训练缓慢滑动的「影子」编码器给出,防止目标本身漂移。第二步,把两条梯度物理隔开:网络从中间一层劈开,下半段共享,上半段长出两条平行支路,一条只答理解题、一条只做特征预测;生成的梯度只准流回共享下半段和视觉投影层,把细粒度画面信息压进底层特征,理解支路则完全听不到生成的声音,只管学会利用这些变好的特征。第三步,生成任务必须「绕不开理解」:按一句复杂指代画框、输出分割掩码、把关键区域高亮成推理证据、用多物体属性关系改写过的文生图。

第三步有个反直觉的数字:同样二十万条文生图数据,随手写的短提示只换来 0.24 分提升、感知成绩还下降;改成富含属性与关系的提示后提升 0.71、四项全升——涨多少取决于任务和理解的关联度,不是样本量。
训练结束,生成支路、预测头、影子编码器整体丢弃,剩下的模型参数、延迟、显存与原来完全一样。在 2B 和 4B 两个规模的从零训练里,感知与空间类任务提升最稳:二维空间感知基准从 69.9 涨到 73.2,计数从 87.7 涨到 90.1,4B 版的部分综合成绩已压过 7B、8B 级的统一模型;纯文本能力不降反略升。机制分析给了原因:深层特征里保住的视觉信息更多,注意力到网络深处仍然聚焦,而对照组的注意力早已弥散。
对影像行业,「训练时在场、部署时退场」这个设计有几个落点。端侧是第一个:相册搜索、拍后问答全靠看图模型,理解变强而体积不变,等于白送——尤其「找出有红色椅子的照片」这类依赖空间和细粒度外观的查询。影像质检与内容审核是第二个:缺陷判断吃的就是底层视觉保真,这条监督路径恰好把细粒度信息压回底层。第三个给统一模型的厂商:生成能力可以当训练脚手架而非产品功能,端上版本只带理解分支,云端版本才带画笔。
存疑的地方也直说。其一,标题里的「生成」有水分——它不是画图,是特征空间里的接龙预测,和扩散模型那种真·像素生成不是一回事,「会画图帮会看图」这条流行叙事,这篇既没证实也没否定。其二,提升不均匀:某个谜题式基准在 4B 上反而从 26.1 掉到 23.6,从零训练时计数与空间还跌过 1.77 分,作者自己也承认这更像「改变了迁移的画像」而非全面提升。其三,训练侧要多花约一成算力,任务体系是一千万样本加一条自动标注流水线,复现门槛在数据工程而非模型本身。
