S3Gym探索LLM自测自评能否转化为自我改进
原文:S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
大语言模型(LLM)越来越多地与外部环境交互并积累大量行为经验,但现有的智能体基准大多将其作为固定策略来评估。因此,智能体能否主动测试自身行为、评判所得经验,并利用这些经验改进未来决策,仍不明确。我们提出S3Gym,一个通过三项耦合能力——自测试、自评判和自我改进——评估LLM自我改进能力的交互式基准。S3Gym将宽松的探索与严格的留出评估分离,并在七个带有可执行环境验证器的文本游戏中实例化这一协议。我们评估了三种融入交互经验的路径:直接的History ICL、基于分数条件化的Summary Memory,以及参数Training。实验表明,自我改进既非自动也非普遍有效。上下文层面的经验能提升部分模型-游戏组合的表现,但最有效的路径强烈依赖于任务结构:当经验可以被压缩为可复用的策略规则时,摘要是有益的;而当成功依赖精确的、依赖状态的信息时,摘要往往不如原始历史。参数训练在某些任务上带来可观收益,但在另一些任务上表现出不稳定的改进和严重的负迁移。这些发现表明,仅识别成功的动作是不够的;智能体还必须将反馈转化为可执行、可迁移的策略。S3Gym为诊断这一过程、识别阻碍智能体将交互经验转化为可靠自我改进的瓶颈提供了统一框架。作者:Jiajun Shi、Siyuan Tao、Yuhao Wu、Zexuan Wang、Jingyuan Zhang