视频压缩被这篇论文换了一种玩法:解码不再是一步步还原,而是让视频生成大模型沿着它学过的画面轨迹走一步。VoRTeC(清华团队,arXiv 2026-09)把开源视频生成模型 Wan2.1 的骨干直接当解码器,把生成式压缩第一次拽进实时区间。
压得越狠越糊,是老矛盾
视频压缩有个死结:码率压得越低,画面越糊。以 H.266/VVC(最新一代国际视频编码标准)和 DCVC 系列(用神经网络替换传统模块的主流编码器)为代表,编解码器优化的都是「逐像素误差」。当码率压到视频会议那种极低水平——每像素连 0.01 比特都不到——这个目标的数学最优解就是「平均值」:纹理被抹成平滑的块,人脸变成一张平均脸。
于是有了生成式压缩:比特不够,就让生成模型把细节「补画」回来。感知上确实锐利,但代价是慢——扩散类模型要迭代几十步,解一帧几秒钟,前后帧还各自补画,容易闪。慢,是这条路线进不了真实产品的死穴。
关键转折:把压缩码当成「路上的一点」,而不是「残缺的草稿」
VoRTeC 没有训练新的生成模型,而是把 Wan2.1 的 13 亿参数流匹配网络(flow matching:一类把「从噪声到画面」看成一条有方向的路径、模型学的是路径上每一点该往哪走的生成模型)原封不动当解码器。

转折在「怎么用」。常规用法把解压结果当残缺草稿,从噪声重新生成,自然要多步。VoRTeC 反过来:把解压出的 latent(模型内部的紧凑特征码)直接看成「已走在生成路径中段的含噪状态」,再训一个小网络从压缩码反推它在路径上的位置——相当于知道「还剩多少噪声」——一步直达终点。
底座全程冻结:基础版不碰大模型参数、不传梯度,只在外面训几个轻量模块;加强版也只加一千万参数的 LoRA(冻结大模型、只训小插件)。
跨帧的一致性靠「尾帧复用」:每组最后一帧解出来后重新编码,充当下一组的锚点。一招两用——省掉重复传锚点的比特,也压掉组边界的跳变闪烁;调锚点帧比例还能在同一条码流上换档码率,不用重训。
成没成
在 UVG、HEVC、MCL-JCV 标准测试集上,感知指标(LPIPS/DISTS,衡量「看上去像不像」而非逐像素误差)全面领先以往的生成式视频编解码器:同等感知质量下省 58%–73% 码率,解码提速 3 到 197 倍——480p 每秒 32 帧、720p 约 13 帧,第一次够到播放器的实时线。对比图里,它用对手一半的码率,把骑手裤腿上的一行小字保得更完整。
但要诚实:它的 PSNR(逐像素保真指标)明显输给 DCVC-RT 和 VVC。它换来的是「好看」,不是「每个像素都对」。
会先长进哪些工作流
最直接的是视频会议和直播的上行端——手机上行带宽最窄,低码率加实时解码正好打在这里。拍摄流程也可能倒过来:手机只传极低码率码流,云端用生成解码器重建「高清版」。存档和点播是另一头:存量视频按极低码率存,播放时实时生成,算力换存储。
它也制造了新问题:解码出的细节是模型「认为合理」的,不是真实发生的。监控取证、医疗影像不能这么解码;内容凭证和水印必须盖在生成解码之后,而不是之前——这会改变整个内容鉴真链路的设计。
局限与存疑
720p 每秒 13 帧是在 A800 级数据中心 GPU 上拿到的,离手机还远;1080p 一帧约 0.25 秒。论文对比图里第一帧写对的字,往后几帧开始变形,实验也只测到 96 帧,长视频的细节漂移尚未证明解决。代码截至发稿未公开,「冻结底座加外挂小模块」能否被别人复现,要等放出来才知道。