研究高效AI评估节省算力是否改变基准结论
原文:Stress-Testing Efficient Responsible-AI Evaluation: When Compute Savings Change Benchmark Conclusions
高效评估改变了用于支持模型行为结论的协议,但人们很少检验:在评估本身变得更廉价之后,这些结论是否仍然稳定。我们对负责任 AI 基准测试中的结论稳健性进行了压力测试:在七种条件下(涵盖批处理、量化、基准缩减及其组合),评估三个稠密模型和混合专家模型在 BBQ 和 BBQ-V 上的表现。我们没有把聚合准确率的保持视为充分条件,而是将准确率、偏见严重程度与普遍性、推理质量、子群体行为、子集成员稳定性、运行时间和实测 GPU 能耗与全量基准 BF16 基线进行对比。更大的批处理使准确率保持在基线 0.35 个百分点以内,子群体变化相对较小,并且在六组模型-数据设置中的五组中降低了能耗。INT8 基本保持质量,但能耗为基线的 1.79–4.26 倍。INT4 则带来更大的、依赖模型和上下文的变化。缩减版基准提供了最一致的节省,但非常小的子集对保留哪些题目明显更加敏感。因此,高效评估应被视为一种测量干预,其有效性必须在基准所旨在支持的各项结论上进行检验。项目网站:https://vectorinstitute.github.io/sustainable-rai-evaluation/,代码:https://github.com/VectorInstitute/sustainable-rai-evaluation。作者:Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza 分类:cs.LG