它不是给目标检测器再补一批类别,而是把“认出背过的名单”改成“按一句人话去图里找东西”。这一步看似只是把文字接到检测器上,实际上改变了影像软件调用视觉模型的方式:功能不必先为每一种对象重新训练,用户可以临时说出目标。
过去为什么总要先列名单
传统目标检测像一场闭卷点名。训练时告诉模型“人、车、狗”有哪些,使用时它就只在这张类别表里画框。遇到“戴红帽的人”“桌下最靠左的杯子”这类带属性和关系的描述,类别名不够用了;每增加一种对象又重新收集、画框和训练,成本很高。
开放集检测,就是允许模型寻找训练类别表之外的对象。此前常见做法是先让图像和文字在整体意义上对齐,再拿文字去匹配局部区域。但“整张图像说了什么”和“这句话具体落在哪几个像素附近”不是一回事,语言如果只在流程末端参与打分,很难真正指挥前面的找框过程。
关键转折:让文字全程参与找框
Grounding DINO 的核心不是多加一个文字标签,而是让图像特征和文字特征在检测流程的三个阶段反复交换信息。所谓特征,就是模型为图像区域或词语提炼出的数字表示。它先让两类特征彼此增强,再用文字筛出最值得检查的图像位置,最后在逐步修正方框时继续参考文字。
这里还有一个细节:当输入“猫、桌子、杯子”时,模型会把彼此无关的短语隔开,避免这些词在理解阶段互相污染;但“红帽子的人”内部的修饰关系仍被保留。于是输入不再只能是类别名,也可以是带属性的指代表达。
论文报告,在完全不使用 COCO 训练集的设定下,模型在 COCO 上得到 52.5 AP。AP 是综合衡量方框准不准、目标漏不漏的分数,越高越好;这个结果支持“语言能把检测能力带到未专门训练的数据上”,但它仍是作者在基准数据集上的结果,不等于任何随口描述都能稳定找对。
它可能进入哪些影像工作流
在相册里,“找出所有海边合照里戴墨镜的人”可以从关键词检索变成实例级定位;在修图软件里,“只把左侧路牌去掉”可先由它给出方框,再交给分割和生成模型精修;在视频中,同一句描述可以为后续跟踪提供第一帧目标;数据生产则能先自动框出长尾对象,再由人工复核。拍摄端也可能用“对焦在穿蓝衣的孩子”替代点按屏幕,但实时预览仍需要更轻的模型和严格的误检保护。
局限:会听话,不等于一定看对
它输出的是方框,不是像素级轮廓,精细修图还要接分割模型。论文也承认会出现假阳性,也就是把不存在或不符合描述的目标圈出来;换一种措辞,结果也可能变化。更重要的是,开放词汇把固定类别表的边界移走了,却没有移走数据偏差、算力成本和安全风险。它适合做可纠正的视觉入口,不适合在无人复核时直接充当事实裁判。