← 返回信息流
模型 arXiv 论文 · Xingjian Wang, Shijian Wang, Yibo Wang, Zihao Yu, Runhao Fu 2026-08-31 11:01 🔥 热度 5

基于合成课程学习的组合式时空视频定位

用合成课程学习提升时空视频定位的组合泛化

原文:Learning Compositional Spatio-Temporal Video Grounding with Synthetic Curriculum

尽管近期的多模态大语言模型(MLLM)在时空视频定位(STVG)上取得了显著进展,现有的评测和训练数据主要集中于简单查询,很大程度上忽视了现实场景中普遍存在的组合式查询——即需要通过联合推理目标的属性及其与其他实体的关系来消歧目标。为弥合这一差距,我们提出组合式时空视频定位(CompSTVG)任务,要求模型处理复杂的文本查询,其中每一个相互交织的属性线索和关系线索对消歧都至关重要。为大规模支持该任务,我们构建了一个合成数据引擎,将时空场景图作为难度度量,并将难度可控的查询合成转化为约束规划问题,生成难度分级的评测与训练数据。基于该引擎,我们提出STVG-CompBench,一个按显式难度分层的基准,同时刻画时间复杂性和空间干扰。对11个代表性STVG模型的评测表明,现有模型在组合式查询上表现不佳,出现整体数据集平均值通常掩盖不了的性能急剧下降。我们进一步构建合成训练数据并提出CurrSTVG,一种课程强化学习框架,带来了持续的提升,其中在最具挑战性的组合式查询上改进最为显著。作者:Xingjian Wang, Shijian Wang, Yibo Wang, Zihao Yu, Runhao Fu 分类:cs.CV

查看原文 ↗ 技术论文多模态

📌 相关阅读

DeepSeek V4 Flash Vision 发布了…… 热度 10 自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 10 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 9