多图场景下细粒度多模态大模型幻觉基准
原文:Fine-Grained Multi Image Object Hallucination Benchmark
多模态大语言模型(MLLM)正日益被部署到需要跨视觉上下文进行复杂推理的多图像场景中。然而,当前MLLM仍然深受物体幻觉的根本性限制——即生成看似合理但与事实不符的物体描述。现有基准主要针对单图像场景设计,或仅提供粗粒度的多图像评估,无法系统性地诊断视觉复杂度和推理需求如何触发幻觉。为填补这一空白,我们提出了MIOH,一个细粒度的多图像物体幻觉基准,它在三种受控对抗压力(视觉上下文规模、感知难度、上下文偏差)下,通过三种多图像推理模式(综合式、比较式、选择性),系统性地评估四类基础任务(存在性、计数、属性、位置)中的物体幻觉。通过对29个模型的评估,我们发现即使是最先进的系统(如GPT-5和Gemini-2.5-Pro)在不同的推理模式和任务中也表现出各不相同的失败模式。我们的评估表明,幻觉不仅源于感知失败,还源于在多张图像间维持物体表征时的整合阶段局限。MIOH为分析多图像物体幻觉提供了一个可控框架,并可作为开发更可靠多模态AI系统的重要评估工具。