Ling-3.0-flash-Fin基准测试发布
原文:This finance-model benchmark card is more useful for what it discloses than for who "wins"
Ling-3.0-flash-Fin的官方基准卡提醒我们,被测试的单元很少仅仅是“模型”。发布的信息显示,大多数运行使用了温度1、top_p 0.95以及最高的推理努力。FinFIRST和FinSearchComp Verified使用了带有Web搜索、访问和Python的通用ReAct框架。SpreadsheetBench使用了Claude Code 2.1.173和LibreOffice 25.8.7,禁用了搜索功能,最大交互轮次为120或300次,任务超时时间为三小时;在那里Ling使用了温度0.6。该图表还混合了不同类型的证据。一些结果来自官方或外部发布的分数,而其他结果则是内部运行。FinSearchComp Verified是一个包含145个问题的内部数据集,附带专家修订的答案,并由GPT-5进行评判。FinCRAFT是内部的。FinFIRST被宣布为“即将推出”,目前尚未公开。这些因素并没有使图表变得无用,而是使声明的范围变得更窄:这些是在几种特定的代理系统、工具预算和评估流程下的报告结果——而不是对原始检查点的纯粹内在排名。金融权重也尚未公开;团队表示它们将于下周发布。一旦发布,最有价值的跟进将是精确的框架、提示、工具适配器、每次运行的差异和故障轨迹。在此之前,这些条形图是一个测试计划,而不是一个独立的再现。由/用户/niacolhealth提交 [链接] [评论]