← 返回信息流
模型 arXiv 论文 · Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg 2026-09-02 17:33 🔥 热度 11

后训练让大语言模型在编程竞赛中达到金牌水准

后训练让LLM在编程竞赛达金牌水平

原文:Post-Training Language Models for Gold-Medal Performance in Coding Competitions

竞技编程已成为衡量大语言模型推理能力的关键测试,IOI和ICPC等国际赛事代表了其中最具挑战性的场景。我们提出一条端到端的专项化流水线,结合大规模题目筛选、合成推理轨迹、监督微调(SFT)和强化学习(RL)。基于22,000道精选题目,我们用SFT和RL训练了Nemotron-3-Nano-CC(30B-A3B),并仅用SFT训练了Nemotron-3-Ultra-CC(550B-A55B)。我们进一步提出GenCorrect,一种反馈驱动的测试时计算策略,可迭代地生成、评估并优化多个候选解法。在IOI 2025上,Nano-CC经后训练后从130分提升至291分,结合GenCorrect达到468分,超过438.3分的金牌线;Ultra-CC则达到502分。基于这些结果,我们开发了一个面向竞赛的Ultra-CC专用系统,并在IOI 2026期间进行前瞻性评估。在与人类选手相同的时间、联网和提交次数限制下,该系统在600分中获得535.4分,同时超过361.12分的金牌线和498.27分的最高人类选手得分。据我们所知,这是首个在IOI题目集上得分超过最高分人类选手的AI系统。

查看原文 ↗ 技术论文大模型发布

📌 相关阅读

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:编程基准翻倍,缓存读取成本直降 75% 热度 14 EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 12 FDE火了,企业会把钥匙交给外人吗? 热度 11 立体4D雷达用于3D目标检测:融合几何对齐与绝对速度估计 热度 10 一个模型场景通吃!它石智航AWE3.7的泛化能力有点狠 热度 10