提出MoE大模型混合精度量化分层位分配方法
原文:Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs
混合精度量化(MPQ)为大语言模型(LLM)的每个线性层分配不同的比特宽度,以在固定预算下最小化量化导致的质量损失。但混合专家(MoE)模型的每个 MoE 块中的每个专家都包含这些线性层,因此分配空间远大于稠密模型。现有方法要么在统一块预算下于每个块内进行分配,要么通过可加代理跨块分配,两者都无法在耦合各块的选择上直接优化模型级目标。我们提出 Q-Strata,一个双层分配器:用廉价的代理指标对块内分配进行排序,并在组装后的量化模型上以模型级目标进行跨块分配。其内层阶段为每个块在精细间隔的预算上缓存候选方案的 Pareto 前沿,使外层阶段只需为每个块设定一个预算,而非为每个线性层设定比特宽度。由于搜索被简化为每块一个预算,外层阶段可直接优化模型级目标,捕捉可加代理所忽略的块间耦合。在 Mixtral-8x7B-Instruct、Qwen1.5-MoE-A2.7B 和 DeepSeek-V2-Lite 上,Q-Strata 在低比特场景下始终实现比统一比特宽度 GPTQ 以及最先进 MoE MPQ 方法 MxMoE 和 GEMQ 更低的 WikiText2 困惑度。代码见 https://github.com/snu-mllab/Q-Strata/tree/main。作者:Deokjae Lee, Sihun Chu, Hyun Oh Song 分类:cs.LG,cs.AI