← 返回信息流
产品 arXiv 论文 · Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen 2026-08-31 16:51 🔥 热度 3

在智能体策略优化中调和过程监督与基于结果的信用分配

在Agent策略优化中调和过程监督与结果信用分配

原文:Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization

基于结果的强化学习为语言模型智能体提供了可验证的反馈,但它将轨迹级优势统一分配给所有决策,在长时程交互中产生粗糙的信用分配。在策略自蒸馏通过仅在训练期间可用的特权信息(PI)重新评估采样行为,提供了更精细的监督。然而,细粒度监督并不等于细粒度信用:PI引起的似然变化描述了额外信息如何改变策略偏好,但并不直接决定一个可执行动作应如何继承已验证的任务结果。这就造成了监督-信用鸿沟。特权信号可能与当前交互状态无关,以与可执行决策错位的token粒度运作,并缺乏强化所需的结果语义。我们提出TASPO,将特权监督转化为基于结果的动作信用。TASPO从已验证的成功经验中构建可应用于决策的PI,在可执行动作层面聚合PI引起的似然偏移,并将相对动作支持度转化为作用在原始轨迹优势上的正的、有界的、保持均值的权重。这样,已验证的结果决定更新方向和平均幅度,而PI只在动作之间重新分配信用。在三个智能体基准上,TASPO比GRPO提升10.6%,并且在未见任务上泛化更好。进一步分析表明,TASPO减少了监督失配,且动作级分配稳定了策略优化过程。这些发现为社区提供了另一个有趣视角。作者:Jingxiao Yang, Wangjie Gan, Yingxuan Zhuang, Wenqi Zhang, Jintao Chen 分类:cs.AI

查看原文 ↗ 技术论文Agent

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 22 【开源】neuronto/agentic-resource-discovery:Neuronto 智能体资源发现(ARD)索引 热度 11 企业级Agent落地样板间!百融硅基员工批量上岗,按结果领工资 热度 10 普及下后端转Agent开发,要达到什么强度!#Agent #程序员 # AI 应用开发 # 大模型 #后端开发 热度 9 AI时代,你还在手搓吗? 热度 9