梯度幅值token选择提升RLVR训练大模型推理
原文:GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning
强化学习(RL),尤其是可验证奖励强化学习(RLVR),近来已成为提升大语言模型(LLM)推理能力的核心范式,在各类推理任务上展现出显著效果。近期研究表明,高熵令牌在模型训练中扮演着极为重要的角色,因为仅使用熵最高的20%令牌进行训练就能带来显著的性能提升。然而,这类高熵令牌为何有益仍缺乏充分理解。在本工作中,我们发现虽然同一答案内的高熵令牌往往与较大的梯度幅值相关,但考虑到答案层面奖励信号的差异,仅凭熵无法在不同答案之间一致地反映令牌的重要性。基于这一观察,我们提出基于梯度幅值的令牌选择(GMTS)方法来量化令牌重要性,该方法利用熵与梯度的关联来近似梯度幅值排序以进行令牌选择。我们发现,在三个推理领域和多种模型规模上,使用按GMTS排名前20%的令牌进行训练始终优于基于熵的令牌选择,表明GMTS为RLVR训练提供了对令牌贡献更细粒度的估计。作者:Outongyi Lv、Yuanwei Zhang、Xiaoqun Zhang。分类:cs.CL、cs.AI、cs.LG