网友在16GB RTX 5080上让Qwen 27B达到75t/s解码
原文:How I got Qwen 3.8 27b running at ~75t/s decode on 16GB RTX 5080
大家好,我最近在尝试各种 LLM 部署方案。在看到大家都在夸 Qwen 3.8 27B 有多好之后,我也受到启发,决定把它部署起来。经过一番参数调优,我成功让它跑出了平均 75 tokens/s 的速度,在 MTP 接受率良好的情况下有时甚至能超过 100 tokens/s。我使用的是:Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller —— jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller · Hugging Face,“这是一个针对 Qwen3.8-27B 基础模型的自定义混合量化版本,专门设计用于在严格的 16GB 显存预算内(如消费级 RTX 4080 / RTX 5080 显卡)塞入多 token 预测(MTP)和长上下文。”以下是我的 llama.cpp 配置:$llamaPath = “C:\Tools\llama-cuda2\llama-server.exe” $modelPath = “D:\models\Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller.gguf” $chatTemplatePath = Join-Path (Split-Path $modelPath -Parent) “chat_template.jinja”,以及一组完整的启动参数,包括 -ngl 99、上下文长度 85000、KV cache 量化 q4_0、--spec-type draft-mtp、--spec-draft-n-max 3 等。下面是最近一次运行的示例:10.17.039.6