这篇有意思的地方,是把训练数据从「逐张打分」变成「一起组队」:一张好照片,放进不合适的一组图文里,也可能教不会模型什么。
训练能把图片和文字对上的大模型,常见做法是从海量网页图文中筛掉模糊、错配或描述太差的样本,再随机凑成一批训练。模型要认出哪段文字属于哪张图,同时排除同批里的其他文字,这叫对比学习。难点在于,单张图文看起来都不错,不代表放在一起有价值:十张几乎一样的海边照片,能提供的辨别练习有限;「红色杯子」和「蓝色杯子」同场,反而可能逼模型认真看颜色。
JEST 的转折是直接给整批数据评分。它先从大量候选图文中取一个大池子,再逐步组成真正用于训练的小批次。评分既看正在训练的模型哪里还不会,也看一个预先训练好的参考模型能否处理:学生答错而参考模型答对的组合,更可能是值得补的一课。每加入一组样本,下一组的价值就重新计算,因为它要和已经选中的图文相互比较。这个机制抓住了单张筛选漏掉的关系。
作者报告,在其图文对比预训练设置下,成组选取比逐张优先选取更有效;最佳高效版本达到相近基准表现时,所需计算量约为对照模型的十分之一。这是论文实验中的训练效率结果,不等于所有视觉大模型都能省下同样算力。
若这种思路进入影像工作流,价值可能发生在训练资料准备阶段:相册检索模型可把易混淆的连拍和相似场景放在一起学;修图助手可把「提亮肤色」与「改变肤色」等容易混淆的图文指令成组训练;画质理解模型也可接触同一场景里不同失真程度的样本。这些是可测试的应用方向,论文并未证明它们已经有效。
限制也很清楚:方法依赖参考模型和大规模候选池,参考模型的偏好会影响什么数据被选中;论文主要验证图文对齐训练,不能直接推断它会改善生成图像的真实感、颜色准确性或视频时序。真正用于影像产品,还需在各自任务和成本条件下重测。
论文:Data curation via joint example selection further accelerates multimodal learning,Talfan Evans、Nikhil Parthasarathy、Hamza Merzic、Olivier J. Hénaff。