别再拿文生视频模型当解码器:GenVC 训出第一个专为压缩而生的视频扩散模型

🧠 大模型影像论文精读 · 2026-09-03 · Video Compression · Diffusion Model · Generative Codec · Distillation
arXiv 2026-07 · 面向超低码率的生成式视频编码;首个为压缩目标从零训练的视频扩散模型

视频压缩圈现在用的生成模型,几乎全是「借来的」。GenVC(arXiv:2607.22772,微软亚洲等)做了一件反直觉的事:不借,从零训一个,训练目标里只有压缩。

**问题出在哪。**把一段视频压到极低码率(每像素只给零点几个比特,相当于弱网视频会议、卫星链路那种量级),传统编码器靠切块、预测、只传残差,压到极限画面就开始碎:块效应、涂抹、人脸糊成色块。于是近两年出现一条新路线:反正画面最终是给人看的,不如只传一个粗糙骨架,让解码端的生成模型把丢掉的细节「想象」回去。但这条路线的通行做法,是抓一个在海量图文对上预训练的扩散模型(扩散模型:一步步把随机噪声「擦」成图像的生成模型)改装成解码器。这有两个先天问题:借来的模型动辄几十亿参数,端上跑不动;更要命的是,它学到的是「怎么凭一段文字画一个好看的片子」,而不是「怎么把一张被压缩毁掉的画面修回去」。

**第一个转折:把「压缩」写进训练目标。**GenVC 从零训练了一个视频扩散模型,见过的每一对输入输出都是「压缩后的粗糙画面 → 高质量重建」。模型直接在像素空间工作,不经过 VAE(把图像先压进低维隐空间的中间层)——因为那一步本身就会丢细节,而复原恰恰丢不起细节。结构上先全局后局部,先恢复整体运动和亮度,再补细纹理。换来的是模型小一个量级:4.78 亿参数,对比借来的十亿级骨干。

**第二个转折更有意思:一步生成的学生会把运动「冻住」。**扩散模型要迭代几十步才能出图,实时解码用不起,所以要「蒸馏」成一步——常见做法 DMD(分布匹配蒸馏:让一步模型直接模仿多步模型的输出分布)一用上去就出怪事:画面质量不错,但人不动、旗帜不飘。作者追下去找到根因:老师(那个多步模型)只见过自己训练时那种带扰动的输入,当学生越练越好、送回老师的信号越偏离老师熟悉的区域,老师的指引就开始瞎指,学生照着改反而越改越歪,形成正反馈死循环。解法叫 Adaptive Score Distillation:每次更新前,先检查这个更新方向和真值方向是否一致,不一致就掐掉。一句话直觉:老师也会看走眼,学生得学会不全信老师。

https://arxiv.org/html/2607.22772v1/Figure2.png

https://arxiv.org/html/2607.22772v1/Figure2_1.png

结果:在超低码率下做到最优感知质量,同等感知指标下比代表性方法 GLVC 平均省 62.5% 码率;单步解码 1080p 在一张 A100 上跑到 15.1 fps。

**能落到哪。**弱网视频会议、直播推流、云游戏回传、卫星与深远海传输,这些带宽见底的场景是直接受益方。更广一层,这篇给影像行业提了个醒:通用生成大模型不是免费午餐,为具体任务从零训一个小的专用生成模型,可能比借几十亿参数的通用模型改装更省也更准。如果这条路线成立,浏览器、聊天软件、相机端都可能各自塞进一个「压缩专用」的生成解码器。

**局限与存疑。**15.1 fps 是 A100 的成绩,离手机端实时还有距离;极限码率下补出来的细节是「合理想象」而非「真实记录」,监控取证类场景要谨慎;62.5% 的节省是相对单一对手测的,优势幅度需要更多横向对比;一步蒸馏的稳定性依赖那个门控机制,换了数据分布是否还稳,有待验证。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读