← 返回信息流
开源 Reddit-LocalLLaMA · /u/gabrielesilinic 2026-08-30 18:51 🔥 热度 4

分享我表现相当不错的 Qwen3.8 27B 本地部署方案,希望对大家有帮助

网友分享Qwen3.8 27B本地部署配置经验

原文:Here my pretty good qwen3.8 27B setup, hope it helps

既然我花时间摸索出来了,而且这东西也不会给我带来任何收益,我想把我拼凑出来的这套配置分享给大家。首先是我的硬件和软件栈的关键信息:操作系统:Debian 13;CPU:8700G;GPU:7900XTX(这款 GPU 和同系列一样拥有 24GB 显存)。我肯定也有系统内存,但这套配置基本不太用到它,所以就不细说了。说点背景:我之前用上一代 Qwen3.6-27B 尝试过类似的方案,但说不清为什么跑得特别慢。我可能要部分归咎于 MTP,而这套配置似乎解决了这个问题。所以我选择了 unsloth 的 Qwen3.8-27B-UD-IQ4_XS.gguf 量化版本,以留出一些余量。无需任何花哨的设置,就能达到约 22 到 30 t/s,表现相当不错。注意 UD 前缀似乎起了某种我解释不了的重要作用,而且它比 unsloth 发布时提供的量化版本更新,所以建议重新下载,至少它比非 UD 版本更小。之前 MTP 失败让我非常困惑,因为很多人都说它能让模型快很多——确实快了,直到我进行长对话时就不行了。于是我把 ChatGPT 派去“文档矿区”挖矿(说实话我不会睡前去读 llama-server 文档),它找到了 --spec-draft-p-min 这个选项,似乎在这里起了很大作用——当置信度低于阈值时它会立即拒绝后续的 MTP。我试着调整过这个参数,但最终定下的数值似乎正合适。最后还有一点有意思的:我重新尝试了 KV cache 量化,现在它不会像之前那样出问题了。简而言之,3 层的深度 MTP 看起来运行良好,如果你的工作负载不同,可以自行调整。我是通过让它构建一个 Vue UI 项目来做“基准测试”的,所以我的生成内容比较无聊和常见,可能不代表所有场景。

查看原文 ↗ 开源项目

📌 相关阅读

[开源] Laffey-82/OFbot2: 可扩展的插件化 QQ 机器人框架:多协议多账号、逐群功能开关、Web 管理后台与插件市场 热度 12 【开源】Morningstar202604/VerdictAI:多智能体法庭辩论与判决系统 热度 10 【开源】AMAP-ML/LoopArena:将模型作为运行时控制器进行循环工程基准测试 热度 9 【开源】franklil0401/proofpick_agent:基于 ReAct 的 Agentic RAG 消费决策智能体 热度 9 三块钱两小时训出你自己的人工智能|GitHub 每日 AI 项目推荐 EP.030 热度 9