探讨超越人类监督的推理模型扩展路径
原文:Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence
大型推理模型(LRM)的最新进展表明,带可验证奖励的强化学习(RLVR)能够显著提升数学和代码领域的推理能力,因为这些领域的答案可以被自动检查。但将这一进展扩展到开放性和智能体任务仍然困难重重,因为可靠的奖励更难获得,而且直接的人类监督无法跟上模型生成经验的规模和复杂度。本文研究当人类监督逐渐退出学习回路后,LRM 如何继续改进。我们从两个相互关联的维度考察这一问题。奖励轴追踪了从逐实例的人类判断,到可复用的验证器,再到无需人类反馈也能运作的奖励的发展路径。经验轴考察学习如何从人类策划的任务和环境,走向自生成的课程、自构建的环境以及自主的共同进化。我们通过一个从 L0 到 L4 的五级阶梯将这两个维度连接起来,用以识别学习过程中哪些部分仍处于持续的人类控制之下。我们的分析还强调了日益自主的奖励与经验生成所带来的风险,包括奖励作弊、反馈漂移、课程坍塌和环境错误。因此,我们进一步围绕三个互补的对象展开评估:策略能力、反馈保真度和经验质量。这一分析为当前超越人类监督扩展 LRM 的方法,以及迈向超级智能的自持续学习系统所涉及的开放问题提供了结构化的阐述。此外,我们维护一个持续更新的 GitHub 仓库以追踪最新进展。作者:Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang。分类:cs.AI