主动学习降低指代图像分割与定位标注成本
原文:Cost-efficient Active Learning for Referring Image Segmentation and Grounding
收集自然语言指代表达连同区域标注(如掩码或边界框)是视觉定位(VG)中的主要瓶颈,因为标注者必须撰写能将目标区域与视觉相似区域区分开来的描述。我们通过在仅有原始图像、无配套文本的现实设定下为 VG 构建主动学习(AL)框架来解决这一问题。由于缺少真实文本,样本选择必须估计哪些图像包含需要判别性指代表达的模糊区域。为此,我们利用基础模型生成辅助的区域-文本对,并提出 Referred Region Ambiguity 这一新的采集函数,用于衡量模型置信度是坍缩到单个区域还是分散在多个候选之间。这使我们的方法能够优先选择具有强烈跨区域竞争的图像,这类图像因视觉模糊性而更具信息量。我们还设计了一个指代表达标注界面,帮助标注者通过几次点击快速专注于撰写判别性语言。在 RIS 和 REC 基准上的实验表明,我们的 AL 框架始终优于多种 AL 基线,用户研究则显示我们的方法可将描述标注速度提升至 1.6 倍。