← 返回信息流
论文 Reddit-LocalLLaMA · /u/Informal-Trouble2183 2026-08-30 22:20 🔥 热度 4

我收集了所有 LLM 编程基准测试,并计算了它们的智能密度

汇总LLM编程基准并计算智能密度指数

原文:I collected every single LLM coding benchmark, and computed their Intelligence Density

我上下文中的智能是一个聚合指数,我称之为 Agentic Coding Index,涵盖了大多数相关的智能体编程基准:SWE-bench Pro、DeepSWE v1.1、Terminal-Bench(v4、v3、v2.1)、Code Arena Elo 和 LiveCodeBench v6。智能/参数 = 规模 x (Agentic Index / 基准值) ^ (超线性指数) / sqrt(参数量 + 参数下限)。基准值:设定中性基线(= 50)。超线性指数:非线性缩放,避免奖励超小模型(否则,勉强能写代码的小模型会人为地霸占排行榜),同时奖励真正的自主能力。规模 = 2.5354。参数量:模型参数数量(以十亿计)。参数下限:模型参数的最小数量(正则化项,避免小于 1B 的模型分数飙升),= 8B。Agentic Coding Index:DeepSWE v1.1(20%)、Code Arena Elo(20%)、Terminal-Bench v4.0(15%)、SWE-bench Pro(15%)、Terminal-Bench v3.0(13%)、Terminal-Bench v2.1(12%)和 LiveCodeBench v6(5%)。数据完整性:所有基准测试分数均来自经过验证的公开和官方来源(模型创建者、经同行评审的评估报告)。提交者:/u/Informal-Trouble2183

🖼 相关图片

查看原文 ↗ 技术论文

📌 相关阅读

MIT最新研究显示:AI文明可能根本不需要语 热度 8 专刊征稿——大模型赋能智慧农业应用 热度 8 如果禁用 H-Neurons,Qwen3.8-27B 或 GLM-5.3-Flash 这类模型会变得多差? 热度 7 智能体适应度函数:将演进式架构扩展至确定性规则之外 热度 7 演讲:在边缘运行 AI——直接在浏览器中运行真实工作负载 热度 6