一稳就呆,一动就断:Diff-VF 不改一个参数,把短视频模型拉成长片

🧠 大模型影像论文精读 · 2026-08-29 · Video Generation · Diffusion · Long Video · Temporal Consistency
arXiv 2026-08 · 长视频生成的时序一致性与动态性
图片来源:Yang et al., arXiv:2608.05976

视频生成模型拍不了长片,病根不在画质,在记性。Diff-VF 给出的结果有点反常:不训一个参数、不动模型结构,只重新安排「去噪」这个过程本身,就把只能拍几秒的模型拉到三四倍长,接缝的跳变和后段的呆滞一起被压了下去。

先看现在大家是怎么干的。主流视频生成模型——Sora、可灵这类产品背后的技术——都是扩散模型:从一团噪声一步步去噪,得到一段视频。训练素材大多只有几秒,长片数据少、算力开销按帧数暴涨,没人养得起端到端的长视频模型。要生成 20 秒,通行做法是滑窗接力:先生成前 5 秒,再以前 5 秒为条件生成下 5 秒,一段段往后滚。

这个做法有两个现成的病。一是接缝:每个窗口独立去噪,窗口交界处画面会跳。二是越往后越不对——要么忘了开头拍的是什么,要么动作越来越小、画面趋近静止。模型对「很久之前」的帧没有约束力,误差一步步累积。

修复分两条路。重训一个长视频模型,贵,每换一次底座重来一次;另一条 training-free(模型原封不动,只在生成过程上做手术)已有几个代表:FreeNoise 复用噪声锁住段与段,连贯但内容重复;FreeLong 改注意力,稳,动作却明显变少;RIFLEx 改位置编码让模型看得更长。这条路线的共性死穴,在评测里看得清清楚楚:一致性分数最高的方法,生成的往往接近静止画面——稳定是靠不动换来的。

Diff-VF 还是走第二条路,转折在于把「长」拆成两个独立问题:全局上要像一部片(不漂移),局部上要接得上(无接缝)。各配一招,再按去噪阶段动态混权。

https://arxiv.org/html/2608.05976v1/overall.jpg

第一招管全局,混合噪声初始化(HNI)。滑窗生成的每一段都从一份起始噪声出发,Diff-VF 把下一段的起始噪声调成「上一段的噪声 + 一份新噪声」的混合:继承样貌,留出变化余地。混合比例是个显式旋钮,直接拧「稳」和「活」的平衡。

第二招管接缝,加权窗口采样(WWS)。相邻窗口本来就有重叠帧,直接取平均接缝照样跳;Diff-VF 按离窗口中心多近来加权,老窗口渐渐淡出、新窗口渐渐淡入,类似剪辑里的叠化。

第三招最反直觉,时间扩展采样(TES),管的是「很久之前」。把长视频的帧重新排序:第 1、9、17、25 帧抽成一条序列,第 2、10、18 帧抽成另一条。模型一次处理的仍是它熟悉的短片长度,但这条短片在时间上横跨很长——远处的帧被强行放进同一个注意力窗口,长程关系没让模型学任何新东西就建立起来。去噪早期画面布局未定,偏向这招的全局结果;进入细节阶段,再切回第二招的局部结果。

在 LaVie 和 HunyuanVideo 两个底座上,这套做法在长视频评测基准 VBench-Long 上同时拿到更高的动态度和不落下风的一致性。最能说明问题的是 HunyuanVideo 那组数:RIFLEx 和 FreeLong 的动态度只有 0.14 和 0.06,Diff-VF 是 0.44——在别人用静止换稳定的评测里,它把动作保住了。论文已被 ACM TOMM 接收。

对产品团队最实际的一点:这是采样层的改动,底座换一代它跟着换一代,不用重训;对算力预算有限、底座迭代慢的团队,这种外挂比自研长视频模型现实得多。落到工作流:广告和短片的「一镜到底」叙事可以直接叠上去;论文还给了条增强路线(SRG)——先超分、再加噪,去噪时早期锁住输入细节、后期放开补真实感——适合把相册里的旧短片拉成更长更清晰的版本;具身智能和世界模型要的长时程一致性,本质也是记性问题,这类不训底座的采样策略可以当低成本补丁先顶着。

代价也直说。WWS 和 TES 都要多路去噪再融合,省的是训练、不是推理,同一部片子的计算量比原生生成更高;抽帧重排能成立,前提是底座在被拉长的序列上仍然去噪得像样,换底座要重调窗口大小、步长这些超参;外推倍数目前是三四倍,几秒到十几秒,离一部片还远,真人长片里的人物身份和跨场景叙事逻辑,也还不是噪声混合能覆盖的。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读