这篇论文有意思的地方,是把「模型压到 4 bit 就掉细节」从一道比特预算题,改写成了一道时间分配题。
视频生成模型贵在推理:生成几秒视频要在噪声里迭代几十步去噪,显存和算力成倍开销。于是工程老办法派上用场——量化:把每层权重和激活值从 16-bit 连续数值压成 4-bit 只能表达的十几个格点,体积省七成以上,延迟最多降四成。代价则是一种熟悉的失败模式:构图对、动作对,但脸糊了,布料和皮肤的高频纹理像被抹过一层油画。

主流补救叫量化感知训练(QAT):训练时就让模型「戴着镣铐练习」,前向按 4-bit 格点走,让网络习惯格点。问题在于现有流程对去噪几十步一视同仁:同一套损失、同一套监督。可去噪不是同一件事重复几十遍:前段从噪声里定构图和运动,后段才是皮肤、织物、锐度这些细节的成型期。
论文先用一组替换实验定位伤情:只量化前段、后段保持全精度,构图略有不同,画质几乎不掉,视觉奖励模型评分 7.90,比全精度参考的 7.51 还略高;反过来只量化后段,构图动作与全精度几乎一致,观感却崩了,评分掉到 3.17。全量化的失败模式只量化后段就能复现——伤害不均匀,集中在后段。
定位清楚,改法分两处。训练侧按阶段换监督:前段继续跟全精度「老师」做蒸馏,噪声大时梯度本来就抖,老师给个低方差锚把结构钉住;越往后蒸馏权重越低,改回直接对真实目标——细节成型期还模仿老师,等于把宝贵的 4-bit 容量花在老师自己也没拟合好的残差上。两套监督用一条随步数平滑变化的曲线衔接,不是硬切换。
推理侧的修改更妙:一行开关,不碰权重。生成模型的标准操作 CFG(classifier-free guidance)是每步跑两遍网络:一遍带提示词、一遍不带,把两者的差放大后加回去,以增强提示词服从。量化后两分支落在不同的舍入格点上,差里混进互不相消的量化误差;到最后几步两分支预测本就趋于一致,差里几乎只剩误差,再被放大系数一乘,就是高频伪影。DSAQuant 在最后几步直接关掉 CFG,顺带省掉一半前向:仅这一项就让 Wan2.1-1.3B 的成像质量单项从 71.67 提到 77.50,而同样操作在全精度模型上收益小得多,说明这是量化专属的红利。关早了不行——超过约十步,VBench 均分开始下滑,论文取九步;这个阈值只在 1.3B 模型上消融过。
效果在五个模型、两档压缩率下都成立(Wan2.1-1.3B/14B、Wan2.2-5B、CogVideoX-2B/1.5-5B):4-bit 下 Wan2.1-1.3B 的 VBench 均分(视频生成常用的自动评测基准)67.21,反超全精度的 66.28;最激进的 3-bit 下,比此前最强的视频量化基线最高多 6.60 分。工程上更直接:量化后的 14B 模型塞进单张 4090D,全精度在同卡上爆显存。
对真实工作流有两层含义。本地和端侧视频生成——相册级编辑、消费级显卡推理、API 降本——多了一个已验证的可选项;而「最后几步关 CFG」是零训练成本的开关,部署了量化视频模型的推理栈都值得先试它,再谈重训。更远一点,「按去噪阶段分配损伤预算」的思路,大概率会外溢到图像生成的量化和蒸馏上。
存疑之处:评测主要靠 VBench 这类自动指标,量化伪影的人眼观感仍需真人评测兜底;可对比的视频原生量化训练基线只有 QVGen 一个,其余压缩基线数字转引自其论文;开源仓库只有推理侧代码、训练管线未放出,Wan 三个模型的 4-bit 权重已放上 Hugging Face,CogVideoX 侧代码权重都缺,复现难度分模型差别很大;关 CFG 的阈值换模型未再验证。