← 返回信息流
论文 arXiv 论文 · Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei 2026-08-31 17:14 🔥 热度 3

Aspire:模型能否从模糊目标中自我进化?

Aspire探索模型如何从模糊目标中自我进化

原文:Aspire: Can Models Self-Evolve from Vague Goals?

人类许多重要的学习形式都始于一个模糊的目标,例如"成为更好的物理学家"或"提升科研能力"。学习者需要解读目标、识别能力差距、决定如何学习,并判断自己是否真正有所提升。相比之下,现有关于大语言模型自我进化的研究通常始于人类指定的任务和评估指标,将自我进化简化为对显式目标的优化,而非决定学什么、怎么学。我们提出了 ASPIRE,一个面向模糊目标驱动自我进化的基准。ASPIRE 仅提供一个自然语言能力目标,下游评估任务保持隐藏。智能体必须通过选择数据和更新方法、构建训练与验证信号、决定何时评估等方式将目标落地。ASPIRE 在统一的交互式环境中同时支持模型权重层面和智能体框架层面的进化,并在一套由专家编写的、覆盖六个目标的 520 道隐藏评测题上评估进化后的系统。实验表明,模糊目标会将搜索精力引导至目标解读上。当前智能体已能常规地完成训练和框架修改的循环,但权重层面的提升仍然稀少且不稳定,最强的进化框架仍低于精心工程化的 Qwen-Agent 参考基线。智能体常常在错配的数据上训练,并信赖狭隘的自我评估,因此局部收益无法迁移到隐藏评估上,持续的搜索和训练还可能抹去先前的改进。作者:Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei 分类:cs.CL

查看原文 ↗ 技术论文

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 19 还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 热度 9 世界模型与大模型安全风险到底哪里不同 热度 8 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 8 LLM量化损伤的结构:为何应将额外比特全局分配 热度 8