分析量化损伤结构,提出全局比特分配方法
原文:The Structure of Quantization Damage in LLMs: Why the Next Bit Should Be Spent Globally
训练后量化(PTQ)被广泛用于降低大语言模型(LLM)的部署成本,但其精度损失并不均匀,且通常需要针对每个模型进行调优。我们研究了量化损伤发生在何处,以及如何分配少量额外的精度预算。以因果混合精度干预作为真值(逐层将各层提升到8比特并测量所恢复的精度),我们测试了3个直观假设:量化损伤存在于任务回路中、存在于模型计算之处,或存在于权重统计中。这些假设都无法预测哪些层会从恢复的精度中受益。相反,恢复是弥散性的:在9个模型中的8个里,恢复75%的性能差距大约需要一半的层;唯一的例外Qwen3-8B则高度集中。在相同的精度预算下,将预算全局用于更细的量化粒度,胜过局部修复最可恢复的层,在全部8个兼容group-128的模型上(除因宽度不兼容group-128的OpenLLaMA之外)领先21-52个百分点,包括高度集中的Qwen3-8B。我们还报告了2项次要发现:残差受预算限制(在我们涵盖RTN、GPTQ和AWQ的评估中,8比特几乎无损),且峰值恢复位置与同族内的架构相关,但在不同族之间则不然。在这一预算设定下,全局粒度比选择性保护关键层是更好的默认策略。更广泛地说,与量化损伤相关的廉价信号不一定能指明恢复精度会在哪里提升精度;这必须通过因果干预来验证。作者:Jundong Hu, Shekar Ramachandran 分类:cs.LG,cs.CL