从失败预测中恢复LLM隐藏的正确推理证据
原文:Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores
当大语言模型在推理任务中失败时,人们往往认为它缺乏相应的底层能力。然而,这混淆了真正的推理能力缺失与后期的输出瓶颈。我们在多个推理基准上观察到一致的读出差距:即使原生序列打分因结构性偏差而完全坍缩,隐状态探针仍能成功解码出正确答案。为了检验特定实例的逻辑是否能在这种坍缩中幸存,我们引入了一种诊断协议,使用一种最小化的、无需目标标签的加性修正。仅在25个无标注样本上拟合两个参数,即可为Qwen3.5模型恢复9至34个准确率百分点,并能成功迁移到OLMo-2-1B和Llama-3.1-8B。至关重要的是,这些恢复出的决策在简单词汇重叠无法解决的困难实例上依然有效,并显著超越了保持计数的置换基线。我们的结果表明,许多表面上的零样本推理缺陷其实是掩盖了完整内部逻辑的表达失败,这提醒人们应以更狭义的方式解读基准评估结果。