← 返回信息流
模型 arXiv 论文 · Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen 2026-08-31 16:41 🔥 热度 3

每个Token都在思维之流中留下涟漪:激发模型内部Token显著性以实现思维链压缩

利用模型内部Token显著性压缩思维链

原文:Every Token Leaves a Ripple in the Stream of Thought: Eliciting Model-Internal Token Saliency for Chain-of-Thought Compression

思维链(CoT)推理提升了多步问题求解能力,但冗长的推理轨迹会推高推理成本。Token级CoT压缩通过将完整推理链剪枝为更短的轨迹以进行模型适配,从而降低这一成本,这使得Token选择成为核心挑战。现有方法通常依赖外部打分器或仅与模型内部答案计算间接相关的启发式信号。我们转而采用模型内部的视角:在模型形成答案的过程中,每个推理Token都会在残差流(即模型的"思维之流")中留下涟漪,而这一涟漪的幅度反映了该Token对答案计算的贡献。基于这一观点,我们提出了MIST(面向Token级CoT压缩的模型内部显著性),它从两个互补的维度定义Token重要性:必要性,即移除某个Token的内部贡献后答案似然的下降幅度;充分性,即仅提供该贡献时答案似然的提升幅度。将两者结合即可得到用于剪枝的统一重要性分数。在四个推理基准和四个模型上,MIST始终优于基线方法,表明模型内部显著性为推理Token重要性提供了有效的代理。

查看原文 ↗ 技术论文大模型发布

📌 相关阅读

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:编程基准翻倍,缓存读取成本直降 75% 热度 26 EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 GPT-6 热度 14 Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线 热度 10 巨简单,更懂家!海信JUOS正式发布:行业首个家庭智能伴侣级AIOS 热度 9