挑训练图文,不能只看单张好不好:JEST 把数据选择变成组队题

🧠 大模型影像论文精读 · 2026-09-26 · Data Curation · Multimodal Learning · Image-Text · Contrastive Learning
arXiv 2024-06 · 图文模型预训练中的成组数据选择

这篇有意思的地方,是把训练数据从「逐张打分」变成「一起组队」:一张好照片,放进不合适的一组图文里,也可能教不会模型什么。

训练能把图片和文字对上的大模型,常见做法是从海量网页图文中筛掉模糊、错配或描述太差的样本,再随机凑成一批训练。模型要认出哪段文字属于哪张图,同时排除同批里的其他文字,这叫对比学习。难点在于,单张图文看起来都不错,不代表放在一起有价值:十张几乎一样的海边照片,能提供的辨别练习有限;「红色杯子」和「蓝色杯子」同场,反而可能逼模型认真看颜色。

JEST 的转折是直接给整批数据评分。它先从大量候选图文中取一个大池子,再逐步组成真正用于训练的小批次。评分既看正在训练的模型哪里还不会,也看一个预先训练好的参考模型能否处理:学生答错而参考模型答对的组合,更可能是值得补的一课。每加入一组样本,下一组的价值就重新计算,因为它要和已经选中的图文相互比较。这个机制抓住了单张筛选漏掉的关系。

作者报告,在其图文对比预训练设置下,成组选取比逐张优先选取更有效;最佳高效版本达到相近基准表现时,所需计算量约为对照模型的十分之一。这是论文实验中的训练效率结果,不等于所有视觉大模型都能省下同样算力。

若这种思路进入影像工作流,价值可能发生在训练资料准备阶段:相册检索模型可把易混淆的连拍和相似场景放在一起学;修图助手可把「提亮肤色」与「改变肤色」等容易混淆的图文指令成组训练;画质理解模型也可接触同一场景里不同失真程度的样本。这些是可测试的应用方向,论文并未证明它们已经有效。

限制也很清楚:方法依赖参考模型和大规模候选池,参考模型的偏好会影响什么数据被选中;论文主要验证图文对齐训练,不能直接推断它会改善生成图像的真实感、颜色准确性或视频时序。真正用于影像产品,还需在各自任务和成本条件下重测。

论文:Data curation via joint example selection further accelerates multimodal learning,Talfan Evans、Nikhil Parthasarathy、Hamza Merzic、Olivier J. Hénaff。

论文来源:arXiv 原文 ↗

← 返回 大模型影像论文精读