在Agent策略优化中调和过程监督与结果信用分配
原文:Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization
基于结果的强化学习为语言模型智能体提供了可验证的反馈,但它将轨迹级优势统一分配给所有决策,在长时程交互中产生粗糙的信用分配。在策略自蒸馏通过仅在训练期间可用的特权信息(PI)重新评估采样行为,提供了更精细的监督。然而,细粒度监督并不等于细粒度信用:PI引起的似然变化描述了额外信息如何改变策略偏好,但并不直接决定一个可执行动作应如何继承已验证的任务结果。这就造成了监督-信用鸿沟。特权信号可能与当前交互状态无关,以与可执行决策错位的token粒度运作,并缺乏强化所需的结果语义。我们提出TASPO,将特权监督转化为基于结果的动作信用。TASPO从已验证的成功经验中构建可应用于决策的PI,在可执行动作层面聚合PI引起的似然偏移,并将相对动作支持度转化为作用在原始轨迹优势上的正的、有界的、保持均值的权重。这样,已验证的结果决定更新方向和平均幅度,而PI只在动作之间重新分配信用。在三个智能体基准上,TASPO比GRPO提升10.6%,并且在未见任务上泛化更好。进一步分析表明,TASPO减少了监督失配,且动作级分配稳定了策略优化过程。这些发现为社区提供了另一个有趣视角。作者:Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen 分类:cs.AI