压的不是画面,是模型「看懂的东西」:视觉特征砍掉 98%,答题几乎不掉分

🧠 大模型影像论文精读 · 2026-09-03 · Neural Compression · Coding for Machines · VLM · Split Inference
arXiv 2026-09 · 端云分工视觉语言模型的中间特征标准化压缩(coding for machines)
图片来源:Heidari, Tavakoli & Kannala, arXiv:2609.01200

图像压缩几十年的默认前提是:解出来是给人看的,所以「重建得像不像」就是好坏的尺子。这篇论文把前提换掉了——当压缩对象是大模型已经「看懂」的中间特征、读者是另一个模型时,尺子得整个换。

https://arxiv.org/html/2609.01200v1/figures/fig_pipeline.png

中间传什么,是个真问题

看视频的大模型流水线分两半:前端的视觉编码器把画面变成一串向量(「视觉 token」,可以理解为模型对画面的速记),后端的语言模型读这些向量加文字问题,写出回答。模型大到塞不进手机和摄像头,于是常见做法是端云分工:设备跑编码器,云端跑语言模型,中间传什么就成了绕不开的问题。

老路有两条,各有死穴。传原视频,带宽巨大,云端还得把视觉编码器再算一遍;走「协同智能」路线,为流水线专门训练特征压缩器——压缩器和下游网络绑死,换模型就得重训,厂商之间互不兼容。

论文把这类中间产物起名叫 AI 流量(AI traffic)——AI 模块之间交换的张量都算——然后问:能不能不训练,拿现成的标准直接压它?

不训练,只插一个标准

作者选的是 MPEG 的神经网络编码国际标准 ISO/IEC 15938-17(NNC,把张量里的数字量化到台阶、再用算术编码省字节,原本是压模型权重的)。他们把它插进 Qwen3-VL-8B 的视觉接口:主视觉 token 外加三路特征流,各自编码、传输、解码再原位塞回去,语言模型拿到的全是解压后的版本。权重、提示词、生成过程一概不动——输出若有变化,只能来自压缩本身。随后把压缩强度旋钮(量化参数 QP)从头拧到尾。

可信度来自对照组:除了「原样直通」还加了「特征清零」——清零后准确率从 0.74 掉到 0.21,证明模型真在乎这些特征,平台期不是蒙出来的。

https://arxiv.org/html/2609.01200v1/figures/fig_videomme_acc.png

结果是一条很陡的「平台—悬崖」曲线:QP 拧到传输量只剩原来的 2%,Video-MME 选择题准确率还停在 0.72(原基线 0.74);开放式的视频摘要任务 MLVU 上请 GPT-4 当裁判,同样的平台之后同样跳水。

第二个发现更关键:解压出来的特征并不是「几乎没损失」。量化把连续数值压成少数几个台阶,逐行相对误差不小,奇异值衰减比原始张量陡得多——可以粗略理解成,信息被挤进了更少的独立方向。重建是糊的,但模型照常答题。作者的解释:语言模型推理吃的是粗结构和相对几何,不是精确的浮点值。

对影像工作流意味着什么

对带宽敏感的采集端——行车记录仪、监控、无人机——「传特征不传画面」从此有了不用训练就能上的标准化选项,通信量降一到两个数量级。而且用的是公开标准,摄像头端的编码器和云端的模型可以来自不同厂商——这是私有量化器给不了的互操作性。

评价体系也得跟着改:评这类编解码器,PSNR 式的重建误差不再是主尺,要画的是「每比特换来多少任务精度」的曲线——作者称之为 rate–task,以区别于传统的 rate–distortion。对做画质评价和编码器调优的人来说,这是个还没有工具链的新命题。

局限也要说清:只测了一个模型,两个基准各抽 100 条样本,开放式评分靠另一个大模型当裁判;没测编解码本身的延迟——省带宽不等于省时延;四路特征共用同一个压缩档位,没按重要性分配码率。雪崩点很陡,真实系统得离拐点留足余量;「任务不掉点」也只在被测任务上成立。

真正会被记住的,大概是那个判断:当数据的读者从人换成模型,压缩的成功标准就得跟着换。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读