VAR 有意思的地方,是把画图的“下一步”从旁边一块,变成整张图的下一层细节。
让模型画一只猫,一条路线是先把图片压成许多小块的编号,再像写句子一样接龙:根据前面的编号预测后面的编号。这叫自回归,也是许多语言大模型生成文字的基本方式。可图片没有天然的阅读顺序:猫的两只耳朵需要互相照应,为什么右耳必须等左边所有块画完?逐块排队还会拖慢生成。
VAR,也就是视觉自回归建模,换了这个顺序。它先用一个编码器,把图片翻译成从粗到细的多层编号网格;后面的层记录前面还没表达好的信息。生成时,模型看已有的粗层,预测更细的一层,而且同层所有位置一起预测。最后再把这些编号还原成图片。可以把它想成先铺构图,再补轮廓和纹理,但模型实际处理的是压缩后的特征,并非直接在缩略图上涂画。论文方法与示意图
这个转折保留了“根据已有内容猜后续”的训练方式,却减少了逐块等待。它追问的是一个更基础的问题:把语言模型的办法搬进影像,是否也得把文字的排列顺序一起搬来?
效果有没有兑现?作者在 ImageNet——一个按物体类别组织的图像库——上做了对照。论文表 3 中,规模相近的逐块模型换成逐尺度方案后,FID 从 18.65 降到 5.22。FID 衡量生成图与真实图在特征分布上的距离,越低通常越好;它不是单张照片的画质分,更不能保证猫爪数量正确。这项对照支持“换生成顺序确实有用”,但数字是作者报告,并非这里重新训练所得。论文表 3
进入产品后,一个值得探索的用法是让用户先确认构图,再花计算量补细节。相册扩图也可以尝试锁住已有画面,只生成边缘;作者已提供补图和局部编辑的官方演示代码。再往前想,广告草图或渲染预览或许能把“整体不满意”和“细节不够”分开处理。不过,交互控制是否稳定、修改会不会牵动别处,都还需要产品级测试。
边界也很清楚:这篇原始工作主要按“猫”“船”等类别生成图片,尚未完成自由文字提示生成,也没有实现视频生成。不能把它的基准优势直接写成今天全面胜过扩散模型。早期粗层若把结构定错,后面补得再精细也未必救得回来——这是这种工作流需要专门检验的风险。它留下的启发很具体:图像生成的效率,除了模型多大,也取决于把什么规定为一步。
原论文:《Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction》,Keyu Tian、Yi Jiang、Zehuan Yuan、Bingyue Peng、Liwei Wang,2024。arXiv:2404.02905