← 返回信息流
模型 arXiv 论文 · Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim 2026-08-31 11:53 🔥 热度 5

细粒度多图像物体幻觉基准

多图场景下细粒度多模态大模型幻觉基准

原文:Fine-Grained Multi Image Object Hallucination Benchmark

多模态大语言模型(MLLM)正日益被部署到需要跨视觉上下文进行复杂推理的多图像场景中。然而,当前MLLM仍然深受物体幻觉的根本性限制——即生成看似合理但与事实不符的物体描述。现有基准主要针对单图像场景设计,或仅提供粗粒度的多图像评估,无法系统性地诊断视觉复杂度和推理需求如何触发幻觉。为填补这一空白,我们提出了MIOH,一个细粒度的多图像物体幻觉基准,它在三种受控对抗压力(视觉上下文规模、感知难度、上下文偏差)下,通过三种多图像推理模式(综合式、比较式、选择性),系统性地评估四类基础任务(存在性、计数、属性、位置)中的物体幻觉。通过对29个模型的评估,我们发现即使是最先进的系统(如GPT-5和Gemini-2.5-Pro)在不同的推理模式和任务中也表现出各不相同的失败模式。我们的评估表明,幻觉不仅源于感知失败,还源于在多张图像间维持物体表征时的整合阶段局限。MIOH为分析多图像物体幻觉提供了一个可控框架,并可作为开发更可靠多模态AI系统的重要评估工具。

查看原文 ↗ 技术论文多模态

📌 相关阅读

自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 9 AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 8 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 8 【中/英】 AI 时代,类型检查会变得更重要吗?🤔 热度 8