← 返回信息流
开源 Reddit-LocalLLaMA · /u/AdventurousSwim1312 2026-08-31 10:22 🔥 热度 6

Qwen3.8-Next-Flash 在单张 rtx 6000 pro 上达到 240 token/s

优化版sglang使Qwen3.8-Next-Flash达240t/s

原文:Qwen3.8-Next-Flash up to 240t/s on single rtx 6000 pro

偶然看到一篇帖子,用打过补丁的 sglang 把新的 Qwen 优化到 178 t/s:https://github.com/jpezzulli/sglang-rtxpro6000。我成功复现了结果(感谢 jpezzulli,无论你是谁),并发现了一些进一步提升速度的空间(该模型 nvfp4 的理论带宽上限约为 280 t/s),于是让 fable 迭代了几天继续压榨性能。结果:单张 rtx 6000 pro maxq(300W)上解码速度接近 240 t/s。补丁针对 https://huggingface.co/RadixArk/Qwen3.8-Flash-Next-NVFP4,直接应用于 sglang 主库。涉及的技巧: - 将 lm head 及更多层从 bf16 进一步量化到 fp8(降低带宽占用) - 对几层进行内核调优以提升 GPU 效率 - MTP 配置调优 接下来几天我会测试的额外技巧: - 进一步把层量化到完整的 nvfp4(可能不值得,因为可能降低性能) - 进一步内核调优以融合一些层 - 对 MTP 做训练后微调,并可选尝试创建 eagle3 head(真正的收益在这里,但不确定实际测试效果如何) 复现资源: - git:https://github.com/gabrielolympie/sglang-flashnext-sm120 - 起步仓库:https://github.com/jpezzulli/sglang-rtxpro6000 - 模型检查点:https://huggingface.co/RadixArk/Qwen3.8-Flash-Next-NVFP4 如果你有让它跑得更快的想法,欢迎提出额外的技巧来测试 :) 测试配置: - Ryzen 9 3950x(16核32线程) - 128GB 内存 @3600(存放 ngram 表) - 1x rtx 6000 pro maxq

查看原文 ↗ 开源项目

📌 相关阅读

[开源] Laffey-82/OFbot2: 可扩展的插件化 QQ 机器人框架:多协议多账号、逐群功能开关、Web 管理后台与插件市场 热度 12 【开源】Morningstar202604/VerdictAI:多智能体法庭辩论与判决系统 热度 10 【开源】AMAP-ML/LoopArena:将模型作为运行时控制器进行循环工程基准测试 热度 9 【开源】franklil0401/proofpick_agent:基于 ReAct 的 Agentic RAG 消费决策智能体 热度 9 三块钱两小时训出你自己的人工智能|GitHub 每日 AI 项目推荐 EP.030 热度 9