← 返回信息流
开源 Reddit-LocalLLaMA · /u/Kernoriordan 2026-08-31 09:34 🔥 热度 6

我是如何让 Qwen 3.8 27B 在 16GB RTX 5080 上跑出约 75 tokens/s 解码速度的

网友在16GB RTX 5080上让Qwen 27B达到75t/s解码

原文:How I got Qwen 3.8 27b running at ~75t/s decode on 16GB RTX 5080

大家好,我最近在尝试各种 LLM 部署方案。在看到大家都在夸 Qwen 3.8 27B 有多好之后,我也受到启发,决定把它部署起来。经过一番参数调优,我成功让它跑出了平均 75 tokens/s 的速度,在 MTP 接受率良好的情况下有时甚至能超过 100 tokens/s。我使用的是:Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller —— jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller · Hugging Face,“这是一个针对 Qwen3.8-27B 基础模型的自定义混合量化版本,专门设计用于在严格的 16GB 显存预算内(如消费级 RTX 4080 / RTX 5080 显卡)塞入多 token 预测(MTP)和长上下文。”以下是我的 llama.cpp 配置:$llamaPath = “C:\Tools\llama-cuda2\llama-server.exe” $modelPath = “D:\models\Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller.gguf” $chatTemplatePath = Join-Path (Split-Path $modelPath -Parent) “chat_template.jinja”,以及一组完整的启动参数,包括 -ngl 99、上下文长度 85000、KV cache 量化 q4_0、--spec-type draft-mtp、--spec-draft-n-max 3 等。下面是最近一次运行的示例:10.17.039.6

查看原文 ↗ 开源项目

📌 相关阅读

[开源] Laffey-82/OFbot2: 可扩展的插件化 QQ 机器人框架:多协议多账号、逐群功能开关、Web 管理后台与插件市场 热度 12 【开源】Morningstar202604/VerdictAI:多智能体法庭辩论与判决系统 热度 10 【开源】AMAP-ML/LoopArena:将模型作为运行时控制器进行循环工程基准测试 热度 9 【开源】franklil0401/proofpick_agent:基于 ReAct 的 Agentic RAG 消费决策智能体 热度 9 三块钱两小时训出你自己的人工智能|GitHub 每日 AI 项目推荐 EP.030 热度 9