提出自动评分标准归纳方法评估科研Agent
原文:Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research Agents
自主科学研究智能体正日益被应用于端到端的科学工作流,包括文献综述、数据分析、实验和报告生成。然而,开放式的科研任务往往没有明确说明完成任务所需的分析、方法和成功标准。这导致智能体可能遗漏重要分析、使用不当方法,或得出证据支持不足的结论。为解决这一问题,我们提出了 AutoSciRub,一个“评估优先”的框架,它在科研执行之前归纳出任务特定的可执行评分标准(rubric),并用其指导执行、标准层面的验证以及迭代修订。AutoSciRub 将欠规范的指令分解为原子化的科学目标,将其与相关文献和任务可见的数据关联起来,并合成具体、可操作、可验证的标准。由此得到的评分标准将隐含的实验与证据要求显式化,为实验和分析提供指导。在修订阶段,基于评分标准的验证会识别未满足的标准,从而实现对科研报告及其支撑产物的针对性完善。在 ResearchClawBench 上,AutoSciRub 持续提升所有受测配置的表现:在固定 Codex 框架下,三个骨干 LLM 平均提升 2.08 分;在固定 DeepSeek-V4-Flash 骨干下,三个智能体框架平均提升 2.95 分。在随机抽样的 AstaBench E2E Discovery 20 个任务子集上,AutoSciRub 在三个智能体框架下平均进一步提升 16.8 分,同时保持或增加了成功完成的任务数量。这些结果表明,评估优先的指导为自主科学研究提供了一种有效且可泛化的控制机制(代码:https://github.com/zjunlp/AutoSciRub)。作者:Xuehai Wang, Haowei Qin, Tongxin Liu, Junkai Li, Buqiang Xu。分类:cs.CL,cs.AI,cs.IR,cs.