提出可恢复性约束的LLM Agent自我进化框架
原文:EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses [R]
LLM Agent 越来越多地 在运行时修改自身的提示词、工具、中间件、资源和执行框架。这种自进化可以提升能力,但一次成功的变异可能留下持久的副作用,且在不同于其产生时的状态下无法被安全地回退。我们提出 EvoUndo,一个用于表示、合成、诊断和独立验证模型生成的自修改在反事实状态下可恢复性的框架。在 600 个未见过的单次自进化任务中,我们识别出 197 个无法通过可恢复性验证的能力提升型变异。在原有的恢复表示下,常规修复策略对这 197 个天然失败案例的恢复数为 0/197。确定性预言机分析在原始恢复语言 L0 下恢复了 48/197,而扩展的恢复演算将经验性预言机恢复率提升至 191/197。随后,一个协议锁定的 2×2 表达力接地干预实验分离出两个瓶颈:当原始语言已足够时,精确状态寻址接地将成功恢复从 0/48 提升至 38/48(79.2%);而扩展恢复语言则使预言机定义的 S1 层中的失败恢复达到 142/143(99.3%)。在主力骨干模型 gpt-oss-120b 上,为更丰富的语言添加精确寻址诊断反而使恢复降至 133/143(93.0%);在 Qwen3.8-27B 上的复现保留了接地和表达力效应,但没有出现这一负面交互,说明后者依赖于具体模型。这些结果表明,可靠的 Agent 自进化需要协同设计验证、状态接地、见证语义和恢复语言表达力,而不能仅依赖迭代式提示。论文:https://arxiv.org/abs/2608.28363