← 返回信息流
模型 HF Blog RSS 2026-09-01 21:39 🔥 热度 9

BenchMIRT:LLM 基准测试到底在测什么?

BenchMIRT新方法可审计LLM基准测试真实测量内容

原文:BenchMIRT: What are LLM benchmarks actually measuring?

BenchMIRT:LLM 基准测试到底在测什么?今天我们推出 BenchMIRT,这是一种新的 LLM 基准测试审计方法,可以在单个提示词层面——即模型被打分的那些问题和任务——进行审查。一个基准测试通常旨在衡量某种特定能力,例如安全性、通用推理或指令遵循。但其中包含的各个任务可能不仅依赖于所声明的目标。以 BBQ 为例,这是一个旨在测试模型是否依赖社会刻板印象的基准测试。其中一道题涉及孙子和祖父尝试预订 Uber,它探测的是年龄偏见,但同时也要求模型理清谁是谁,并根据提供的证据而非假设进行推理。即便在同一个基准测试内,不同的问题和任务组所衡量的东西也可能不同。例如 WildJailbreak 同时包含有害的越狱提示词和旨在测试模型是否过度拒绝无害请求的良性提示词。有害提示词与安全性的关联更紧密,而良性提示词则与通用推理的关联更紧密。把它们平均成一个基准测试总分可能会掩盖这种差异。BenchMIRT 帮助研究者分离这些信号,看清究竟是什么在驱动基准测试的得分。它通过分析模型在每个问题或任务上的表现,并估计哪些底层能力与答对题目最相关来实现这一点。寻找基准测试内部的信号 BenchMIRT 借鉴了项目反应理论(IRT)的思路,这是一种源自心理测量学的技术——该领域关注如何从测试反应模式中衡量能力和特质。IRT 的出发点很简单:并非每个问题都能提供同等信息量来了解应试者。有些题目更难,有些题目则更善于区分强者和弱者。此前已有研究者将单维 IRT 应用于个别基准测试,包括我们的 Fluid Ben

查看原文 ↗ 技术论文大模型发布

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 25 GPT-6 热度 17 「GPT-6」灰测demo刷屏!周四发布在即 热度 10 揭开人类丝滑变道的秘密,计算神经科学新成果绘出三大脑区连续决策地图 热度 9 Gemini 推出智能体视频理解能力 热度 9