用模型检测作oracle自动测试LLM事后解释器
原文:Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle
大语言模型(LLM)被用作序列决策策略的事后解释器,以自然语言解释为何选择某个动作。然而,LLM 常常生成看似合理但不正确的表述,而现有方法尚无系统性地测试这些解释是否忠实于底层环境。这面临两个经典的软件测试难题:一是解释正确性缺乏测试预言(oracle),二是测试输入——关于策略行为的自然语言查询——缺乏系统性测试用例生成所需的结构。我们对这两个问题都给出了解决方案。概率模型检测提供了测试预言,计算精确的参考结果,据此自动评判 LLM 的回答。通过事后查询类别的分类体系,我们围绕构成策略解释的环境级事实对输入空间进行结构化,并依据特定问题的诊断难度分数对生成的测试用例进行优先级排序。在七个 MDP 环境中,该测试方法区分了三个开源权重 LLM:一个推理模型通过了 85% 的测试用例,一个中等规模模型通过 70%,而一个 1B 模型低于随机基线;同时,优先级排序显著挖掘出比随机选择更难的用例。我们的结果揭示了 LLM 生成的解释在无模型设置中的可信度——同样的 LLM 被使用,但不存在验证它们的预言。作者:Dennis Gross, Helge Spieker 分类:cs.AI,cs.LG