← 返回信息流
模型 Reddit-LocalLLaMA · /u/PyaesoneP 2026-08-30 13:56 🔥 热度 3

别小看EXL3量化模型

EXL3 Quants模型运行体验分享

原文:Don't Sleep on EXL3 Quants

我正在运行Muse Glimmer 30B EXL3-SC 3.00bpw H4,完全驻留在我的12GB VRAM GPU上,Q8_O KV缓存,100K上下文。在VRAM受限的笔记本电脑上使用如此规模的密集30B模型,还能获得约30 tok/s的速度,这非常令人愉悦。它应该只比官方的17GB K量化模型稍差一点,但在我的Hermes Agent使用场景中,我没有注意到质量差异。它只是快得多。我还尝试了Qwen 3.8 27B的SC2.20bpw H3。绝对可用,但我坚持使用Unsloth UD_Q4_K_XL用于Qwen 3.8 27B,因为它主要用于编码。

🖼 相关图片

查看原文 ↗ 大模型发布

📌 相关阅读

腾讯混元4提前发布即提价, AI 收入兑现才刚开始 热度 9 如何打破求学阻碍? Gemma 4开放 大模型 助力视障学子与法学辩手跨越知识高墙! 热度 8 Qwen 3.8 Flash 目前在推理(llama.cpp)方面的现状如何? 热度 8 「GPT-6」灰测demo刷屏!周四发布在即 热度 7 快来给 Qwen 3.8 投票 热度 6