画图不必一步步擦噪声:LCM 把漫长生成压成几次跳跃

🧠 大模型影像论文精读 · 2026-09-26 · Image Generation · Diffusion · Model Distillation · Efficient Inference
arXiv 2023-10 · 将文生图扩散模型蒸馏为少步生成模型

这篇论文有意思的地方,是把文生图的“反复擦噪声”改成了“从途中任一点认出终点”。

平时用扩散模型画图,可以想成从满屏雪花开始,按文字要求一遍遍擦出轮廓、材质和光影。每改一句提示词,机器又要走完许多轮。等待一长,修图师就很难边看边调;如果简单跳过大部分轮次,画面又可能散掉。问题并非只在运算器快慢,而在模型原本学的是“下一小步怎么走”,没有学会“现在直接走到哪里”。

Luo 等人的潜在一致性模型(LCM)换了教学目标:先让已有的文生图扩散模型当老师,再训练一个学生。所谓“潜在空间”,就是把大图压成较小的内部表示,让模型在这份简图上工作;所谓“一致性”,是同一条生成路线上的不同中途状态,应该指向同一个最终画面。老师演示如何沿着文字引导的路线前进,学生则学习跨过中间步骤,直接预测路线的终点。关键转折不是把旧步骤粗暴删掉,而是重新训练模型回答一个不同的问题。

https://raw.githubusercontent.com/luosiallen/latent-consistency-model/main/teaser.png

论文在文生图实验中展示了两到四步生成高分辨率图像,并与其他少步生成方法比较。这个结果说明少步输出仍能形成可看的画面,但“步数少”不等于任意手机上实时出图:文字编码、图像解码、模型体积和硬件都会占时间。论文还给出针对特定图像集继续调整学生模型的办法,让少步生成有机会适配固定风格。

它最容易进入的工作流,是需要反复试探的画面构思:相册封面、修图里的背景草案、视频分镜或渲染前的气氛图,都可以先快速给出几个方向,再用较慢的流程做终稿。这是应用推断,不是论文已经验证的产品功能。更重要的边界是,本文主要检验文字生成图像;对真实照片的局部编辑能否保住原有细节、连续视频会不会闪烁、端上耗电是否可接受,还需要分别测试。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读