← 返回信息流
行业 arXiv 论文 · Deokjae Lee, Sihun Chu, Hyun Oh Song 2026-08-31 10:39 🔥 热度 5

Q-Strata:面向 MoE 大模型混合精度量化的层级比特分配方法

提出MoE大模型混合精度量化分层位分配方法

原文:Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs

混合精度量化(MPQ)为大语言模型(LLM)的每个线性层分配不同的比特宽度,以在固定预算下最小化量化导致的质量损失。但混合专家(MoE)模型的每个 MoE 块中的每个专家都包含这些线性层,因此分配空间远大于稠密模型。现有方法要么在统一块预算下于每个块内进行分配,要么通过可加代理跨块分配,两者都无法在耦合各块的选择上直接优化模型级目标。我们提出 Q-Strata,一个双层分配器:用廉价的代理指标对块内分配进行排序,并在组装后的量化模型上以模型级目标进行跨块分配。其内层阶段为每个块在精细间隔的预算上缓存候选方案的 Pareto 前沿,使外层阶段只需为每个块设定一个预算,而非为每个线性层设定比特宽度。由于搜索被简化为每块一个预算,外层阶段可直接优化模型级目标,捕捉可加代理所忽略的块间耦合。在 Mixtral-8x7B-Instruct、Qwen1.5-MoE-A2.7B 和 DeepSeek-V2-Lite 上,Q-Strata 在低比特场景下始终实现比统一比特宽度 GPTQ 以及最先进 MoE MPQ 方法 MxMoE 和 GEMQ 更低的 WikiText2 困惑度。代码见 https://github.com/snu-mllab/Q-Strata/tree/main。作者:Deokjae Lee, Sihun Chu, Hyun Oh Song 分类:cs.LG,cs.AI

查看原文 ↗ 技术论文硬件算力

📌 相关阅读

AIVC只是前菜!复旦提出生命算子,统一生命建模 热度 14 自进化WAM来了!清华AIR联手域变换提出具身In-Context Causal Learning 热度 10 129亿美元买下 AI 心脏,NVIDIA收购Hugging Face底层逻辑 热度 9 智能 + 持续学习 = 专业知识 —— 来自 NeoCognition 的 Yu Su 热度 9 125-基于深度学习的黄瓜病害识别系统-yolo11(附赠任务书、开题报告模板课程) 热度 9