← 返回信息流
论文 arXiv 论文 · Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza 2026-08-31 17:13 🔥 热度 3

高效负责任AI评估的压力测试:当算力节省改变基准结论时

研究高效AI评估节省算力是否改变基准结论

原文:Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions

高效评估改变了用于支持模型行为结论的协议,但人们很少检验:在评估本身变得更廉价之后,这些结论是否仍然稳定。我们对负责任 AI 基准测试中的结论稳健性进行了压力测试:在七种条件下(涵盖批处理、量化、基准缩减及其组合),评估三个稠密模型和混合专家模型在 BBQ 和 BBQ-V 上的表现。我们没有把聚合准确率的保持视为充分条件,而是将准确率、偏见严重程度与普遍性、推理质量、子群体行为、子集成员稳定性、运行时间和实测 GPU 能耗与全量基准 BF16 基线进行对比。更大的批处理使准确率保持在基线 0.35 个百分点以内,子群体变化相对较小,并且在六组模型-数据设置中的五组中降低了能耗。INT8 基本保持质量,但能耗为基线的 1.79–4.26 倍。INT4 则带来更大的、依赖模型和上下文的变化。缩减版基准提供了最一致的节省,但非常小的子集对保留哪些题目明显更加敏感。因此,高效评估应被视为一种测量干预,其有效性必须在基准所旨在支持的各项结论上进行检验。项目网站:https://vectorinstitute.github.io/sustainable-rai-evaluation/,代码:https://github.com/VectorInstitute/sustainable-rai-evaluation。作者:Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza 分类:cs.LG

查看原文 ↗ 技术论文

📌 相关阅读

EvoUndo:面向 LLM Agent 运行框架的可恢复性约束自进化方法 热度 19 还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 热度 9 世界模型与大模型安全风险到底哪里不同 热度 8 手撸刑法 大模型 实录|零基础用Qwen+LoRA微调,百万卷宗RAG落地(附凌晨报错截图) 热度 8 LLM量化损伤的结构:为何应将额外比特全局分配 热度 8