SnapGen++ 有意思的地方,是把“每档手机各练一个画图模型”,变成“一套模型里练好几个大小,部署时按算力取用”。
在手机上输入一句话生成壁纸,云端方案要等网络,本地方案则可能等计算。画面越大,模型要协调的区域越多:既要知道城堡在山上,又要画清砖缝。让每块区域都仔细查看所有其他区域,内存和耗时很快就吃不消。直接缩小模型,又容易丢掉复杂构图与细节;换一档手机,还得重新权衡。
Dongting Hu 等人的 SnapGen++ 从这个部署难题出发,以下按论文第二版解读。它采用扩散生成:从杂乱噪声逐步整理出图像;负责协调各区域关系的网络叫扩散 Transformer。作者先给它分工:全局只读一份压缩过的概览,局部仔细看附近区域,再按内容混合两边的信息。中间阶段还把画面表示缩小,把较多计算放到这里完成。原文第 3.1 节
更值得注意的是“弹性训练”:大小版本共享大部分权重,训练时轮流练习,小版本还要学习完整版本的输出。它像一套套叠的工具箱,部署时拿适合设备的那层,不必把每种尺寸从头训练一遍。随后再做蒸馏——让小模型模仿强模型——并请已经会少步出图的老师示范,教学生缩短生成过程。原文第 3.2—3.3 节
成了吗?作者在 iPhone 16 Pro Max 上展示了约百万像素的生成,小版本四步出图。附录报告约 1.8 秒,正文另有约 1.7 秒的口径,因此更稳妥的结论是“这台设备上已演示秒级生成”。这适合点一下、等结果的交互,离相机连续预览仍有距离。原文附录 A—B
沿着这条路线,产品可以先从离线壁纸、聊天贴纸、拍摄前的场景草图切入。进一步的设想,是相册先在本机快速提供构图候选,再把选中的方案交给更大模型细化;视频剪辑也可先生成分镜草案。收益不只是少等几秒,还可能减少私人素材上传。但这些属于应用推演,论文展示的文生图不能直接证明它会保留照片里的人脸,也不能证明它能稳定编辑视频。
边界同样清楚:弹性不等于所有尺寸画质相同,少步版本也有评分回落。基准分数衡量的是特定测试里的表现,不代表手机上每句提示都可靠;训练仍依赖强大的教师模型。若真要进入日常影像工具,下一步该测的是连续生成后的发热、耗电,以及文字、人物身份和局部细节能否守住。实验与训练说明