利用模型内部Token显著性压缩思维链
原文:Every Token Leaves a Ripple in the Stream of Thought: Eliciting Model-Internal Token Saliency for Chain-of-Thought Compression
思维链(CoT)推理提升了多步问题求解能力,但冗长的推理轨迹会推高推理成本。Token级CoT压缩通过将完整推理链剪枝为更短的轨迹以进行模型适配,从而降低这一成本,这使得Token选择成为核心挑战。现有方法通常依赖外部打分器或仅与模型内部答案计算间接相关的启发式信号。我们转而采用模型内部的视角:在模型形成答案的过程中,每个推理Token都会在残差流(即模型的"思维之流")中留下涟漪,而这一涟漪的幅度反映了该Token对答案计算的贡献。基于这一观点,我们提出了MIST(面向Token级CoT压缩的模型内部显著性),它从两个互补的维度定义Token重要性:必要性,即移除某个Token的内部贡献后答案似然的下降幅度;充分性,即仅提供该贡献时答案似然的提升幅度。将两者结合即可得到用于剪枝的统一重要性分数。在四个推理基准和四个模型上,MIST始终优于基线方法,表明模型内部显著性为推理Token重要性提供了有效的代理。