EXL3 Quants模型运行体验分享
原文:Don't Sleep on EXL3 Quants
我正在运行Muse Glimmer 30B EXL3-SC 3.00bpw H4,完全驻留在我的12GB VRAM GPU上,Q8_O KV缓存,100K上下文。在VRAM受限的笔记本电脑上使用如此规模的密集30B模型,还能获得约30 tok/s的速度,这非常令人愉悦。它应该只比官方的17GB K量化模型稍差一点,但在我的Hermes Agent使用场景中,我没有注意到质量差异。它只是快得多。我还尝试了Qwen 3.8 27B的SC2.20bpw H3。绝对可用,但我坚持使用Unsloth UD_Q4_K_XL用于Qwen 3.8 27B,因为它主要用于编码。