Aspire探索模型如何从模糊目标中自我进化
原文:Aspire: Can Models Self-Evolve from Vague Goals?
人类许多重要的学习形式都始于一个模糊的目标,例如"成为更好的物理学家"或"提升科研能力"。学习者需要解读目标、识别能力差距、决定如何学习,并判断自己是否真正有所提升。相比之下,现有关于大语言模型自我进化的研究通常始于人类指定的任务和评估指标,将自我进化简化为对显式目标的优化,而非决定学什么、怎么学。我们提出了 ASPIRE,一个面向模糊目标驱动自我进化的基准。ASPIRE 仅提供一个自然语言能力目标,下游评估任务保持隐藏。智能体必须通过选择数据和更新方法、构建训练与验证信号、决定何时评估等方式将目标落地。ASPIRE 在统一的交互式环境中同时支持模型权重层面和智能体框架层面的进化,并在一套由专家编写的、覆盖六个目标的 520 道隐藏评测题上评估进化后的系统。实验表明,模糊目标会将搜索精力引导至目标解读上。当前智能体已能常规地完成训练和框架修改的循环,但权重层面的提升仍然稀少且不稳定,最强的进化框架仍低于精心工程化的 Qwen-Agent 参考基线。智能体常常在错配的数据上训练,并信赖狭隘的自我评估,因此局部收益无法迁移到隐藏评估上,持续的搜索和训练还可能抹去先前的改进。作者:Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei 分类:cs.CL