用合成课程学习提升时空视频定位的组合泛化
原文:Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum
尽管近期的多模态大语言模型(MLLM)在时空视频定位(STVG)上取得了显著进展,现有的评测和训练数据主要集中于简单查询,很大程度上忽视了现实场景中普遍存在的组合式查询——即需要通过联合推理目标的属性及其与其他实体的关系来消歧目标。为弥合这一差距,我们提出组合式时空视频定位(CompSTVG)任务,要求模型处理复杂的文本查询,其中每一个相互交织的属性线索和关系线索对消歧都至关重要。为大规模支持该任务,我们构建了一个合成数据引擎,将时空场景图作为难度度量,并将难度可控的查询合成转化为约束规划问题,生成难度分级的评测与训练数据。基于该引擎,我们提出STVG-CompBench,一个按显式难度分层的基准,同时刻画时间复杂性和空间干扰。对11个代表性STVG模型的评测表明,现有模型在组合式查询上表现不佳,出现整体数据集平均值通常掩盖不了的性能急剧下降。我们进一步构建合成训练数据并提出CurrSTVG,一种课程强化学习框架,带来了持续的提升,其中在最具挑战性的组合式查询上改进最为显著。作者:Xingjian Wang, Shijian Wang, Yibo Wang, Zihao Yu, Runhao Fu 分类:cs.CV