这篇论文没有把视频生成模型变得更能打,它回答的是一个更工程、也更普遍的问题:当模型被压到只剩 3 比特,为什么最先丢掉的偏偏是质感——以及怎么把这份质感买回来。
问题:压得越狠,画面越「肉」
Wan、CogVideoX 这类视频扩散模型的生成方式,是从一团纯噪声出发,一步一步把噪声「擦掉」,每一步都要过一遍几十亿参数的网络。想在手机、相机这类设备上跑,靠的是量化:把网络里的 16 位浮点数换成 4 比特、3 比特的整数,显存和算力近乎按比例砍掉。3 比特意味着每个数只剩 8 个档位。为了让模型提前适应这种「戴着镣铐工作」,通常用量化感知训练(quantization-aware training,训练阶段就把取整误差算进去)。
这套做法在视频模型上有个尴尬的规律:已有的最强方法(如 QVGen)能把构图和运动保住,但细节先崩——纹理变糊、锐度下降,画面整体「变肉」。此前大家把量化当成一种均匀的噪声,用一套统一的超参和监督去对付整条去噪轨迹。DSAQuant 认为,问题恰恰出在「一视同仁」。
转折一:训练时,早晚期换不同的老师
去噪不是匀速过程。头几步决定画面里有什么、怎么动;后几步决定外观质感这些高频细节。而扩散模型在头几步的训练目标本身方差极大——让一个只剩 8 个档位的模型去硬拟合这种高噪声目标,只会学进一堆取整噪声。
DSAQuant 的做法是分阶段换监督:早期直接照抄一个全精度老师(蒸馏),把结构和运动锚住;到了后段,低比特容量不该再浪费在模仿老师的残差上,于是切回扩散模型自己的原生训练目标,专心把细节修出来。两段之间用一条随时间平滑换轨的加权损失接起来,不是硬切换。
转折二:推理时,最后几步关掉 CFG
第二处改动在部署侧。视频扩散模型靠 CFG(classifier-free guidance,无分类器引导)来强化提示词的指挥权:每一步要算「有提示」和「无提示」两次预测,把两者之差放大后加回去。量化之后,两条分支被压在不同的数值格点上,各自的误差并不同步——末段本来引导信号已趋近于零,取差再放大几倍,就等于把两份不相干的量化噪声相减后放大,高频伪影正是这么来的。
DSAQuant 在去噪的最后几步直接关掉 CFG:伪影的源头没了,而且无条件那一次前向也不用再算——尾段每一步少跑一整条分支,画质和速度是同一个改动带来的。

成没成
在 Wan 1.3B/5B/14B 和 CogVideoX 上,用视频生成常用的自动评测集 VBench 打分:4 比特(权重激活均 4 比特)下比此前最好的量化方法高 1.4–2.1 分;最狠的 3 比特设定下高 2.6–6.6 分,其中 1.3B 的小模型涨得最多。越小的模型、压得越狠,「按阶段分工」的收益越大——这符合直觉:档位越少,越经不起把预算花错地方。
会进哪些工作流
- 端侧视频生成:3 比特可用,意味着显存门槛整体下移一档,手机端的文字生成视频、生成式变焦和夜景视频这类功能离落地更近。
- 推理加速白送:末段去 CFG 对全精度模型同样省算力,这是一个可以单独抄走的部署技巧,不绑定量化。
- 更一般的启示:压缩不该被当成均匀噪声,「什么时候允许压、压哪里」本身是设计自由度——同样的分段思路可以搬到图像编辑模型和实时生成管线上。
局限与存疑
CFG 的关闭窗口要小心调:论文自己的消融显示,关掉超过十步左右就开始伤语义完整性。作者也坦承,关 CFG 对全精度模型同样略有好处,说明它并不完全是量化专属的药方。评测主要依赖 VBench 这类自动指标,「质感回来了多少」最终还需人眼复核。另外,开源的是推理侧代码和量化后权重,量化感知训练的完整流程未放出,想复刻训练配方还得等。