汇总LLM编程基准并计算智能密度指数
原文:I collected every single LLM coding benchmark, and computed their Intelligence Density
我上下文中的智能是一个聚合指数,我称之为 Agentic Coding Index,涵盖了大多数相关的智能体编程基准:SWE-bench Pro、DeepSWE v1.1、Terminal-Bench(v4、v3、v2.1)、Code Arena Elo 和 LiveCodeBench v6。智能/参数 = 规模 x (Agentic Index / 基准值) ^ (超线性指数) / sqrt(参数量 + 参数下限)。基准值:设定中性基线(= 50)。超线性指数:非线性缩放,避免奖励超小模型(否则,勉强能写代码的小模型会人为地霸占排行榜),同时奖励真正的自主能力。规模 = 2.5354。参数量:模型参数数量(以十亿计)。参数下限:模型参数的最小数量(正则化项,避免小于 1B 的模型分数飙升),= 8B。Agentic Coding Index:DeepSWE v1.1(20%)、Code Arena Elo(20%)、Terminal-Bench v4.0(15%)、SWE-bench Pro(15%)、Terminal-Bench v3.0(13%)、Terminal-Bench v2.1(12%)和 LiveCodeBench v6(5%)。数据完整性:所有基准测试分数均来自经过验证的公开和官方来源(模型创建者、经同行评审的评估报告)。提交者:/u/Informal-Trouble2183