码率压到底、细节靠现场『想』:VoRTeC 把视频生成大模型改造成实时解码器

🧠 大模型影像论文精读 · 2026-09-04 · Video Compression · Flow Matching · Video Generation · Latent Representation
arXiv 2026-09 · 基于视频生成大模型的实时生成式视频压缩

这篇论文有意思的地方,不是又把码率压低了一截,而是把「解码」这件事本身换掉了:接收端不再从码流里抠像素,而是让一台冻结的视频生成大模型,一步把画面重新「想」出来。

视频通话卡成马赛克、无人机回传糊成一片,根源在于传统视频编码干的是「搬运」:把每一帧的像素尽量原样塞进码流。带宽够,细节就都在;带宽不够,细节就被砍掉,画面变成色块和涂抹感。最新的国际编码标准 H.266 已经把搬运效率逼到极限,但极限仍然是极限。近两年出现了另一条路线——生成式压缩:发送端只传一份极低码率的草图,接收端用生成大模型把细节补回来;头发丝、草地、布纹不用传,模型本来就知道它们长什么样。卡点是那一步「补」通常要跑几十步迭代去噪,解一帧要几秒,视频通话根本用不了;而且视频要分段生成,段与段的接缝处经常颜色一跳、人脸细节换了一套。

VoRTeC(arXiv:2609.02291)把这几件事一次拆掉。底座是开源视频生成大模型 Wan2.1 里那个 1.3B 参数的流匹配网络——流匹配可以理解成扩散模型的近亲,模型学一条从噪声到干净画面的路径;整个底座被完全冻结,不调一个参数。

https://arxiv.org/html/2609.02291v2/fig_pipeline.png

第一步,发送端压的不是像素,而是模型的内部表示:视频先过 Wan2.1 自带的 3D VAE(把视频压成紧凑 latent 向量的编解码器,latent 即模型内部那份压缩表示),再用成熟的神经编码模块把 latent 压进码流。latent 体积比像素小得多,这一步本身就省码率。

第二步是全文最巧的一处。传到接收端的 latent 带着压缩损伤,相当于给干净 latent 撒了一层噪声。作者于是问:这份带损伤的 latent,等价于生成路径上哪一时刻的中间状态?他们推出一个闭式解,用损伤程度直接算出它「站在路径的百分之几处」,再让冻结的生成网络只走一步,把这份半成品直接推到终点。以前的生成式解码按固定步数反复去噪,现在是先判断「你有多脏」,再一步洗到位。论文的消融实验显示,把这个时刻固定成常数,感知质量会大幅下滑——这一步判断正是速度和质量能同时保住的原因。

第三步解决接缝:每一段解码完,把最后一张重建帧重新编码成 latent 存起来,当作下一段的上下文,而且这段上下文不再进码流,等于白赚一份跨段一致性——肉眼可见的效果是跨段的眼睛颜色、纹理不再跳变。

整体效果:与扩散类生成压缩方法相比,感知质量打平的前提下码率省约六到七成,解码快 3–197 倍,480p 每秒 32 帧、720p 约 13 帧,已经摸到实时;再加一枚小 LoRA(只训练一小片插入参数)还能再提一截,训练一张单卡就装得下。

往真实工作流看,弱网视频会议、无人机与运动相机的窄上行链路、相册云备份,都可能改成「传 latent 草图、收端重建」。更深一层:解码器本身就是一台生成模型,压缩、编辑、重打光开始共享同一个 latent 空间——码流不再是一堆死像素,而是一份能继续被模型操作的场景表示。

存疑处也要说清:重新生成的细节是「符合统计规律的」,不是「真实发生过的」,极低码率下文字、人脸、车牌被补错的风险,论文没有展开;底座的训练分辨率偏 480p,1080p 解码掉到每秒 4 帧以内,编码端比解码端更慢;省下的六到七成是对扩散类同行算的,对 H.266 的优势主要在低码率下的观感,不是全面碾压。生成式压缩这本账,最终要用感知与语义保真的尺子重新来算。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读