优化版sglang使Qwen3.8-Next-Flash达240t/s
原文:Qwen3.8-Next-Flash up to 240t/s on single rtx 6000 pro
偶然看到一篇帖子,用打过补丁的 sglang 把新的 Qwen 优化到 178 t/s:https://github.com/jpezzulli/sglang-rtxpro6000。我成功复现了结果(感谢 jpezzulli,无论你是谁),并发现了一些进一步提升速度的空间(该模型 nvfp4 的理论带宽上限约为 280 t/s),于是让 fable 迭代了几天继续压榨性能。结果:单张 rtx 6000 pro maxq(300W)上解码速度接近 240 t/s。补丁针对 https://huggingface.co/RadixArk/Qwen3.8-Flash-Next-NVFP4,直接应用于 sglang 主库。涉及的技巧: - 将 lm head 及更多层从 bf16 进一步量化到 fp8(降低带宽占用) - 对几层进行内核调优以提升 GPU 效率 - MTP 配置调优 接下来几天我会测试的额外技巧: - 进一步把层量化到完整的 nvfp4(可能不值得,因为可能降低性能) - 进一步内核调优以融合一些层 - 对 MTP 做训练后微调,并可选尝试创建 eagle3 head(真正的收益在这里,但不确定实际测试效果如何) 复现资源: - git:https://github.com/gabrielolympie/sglang-flashnext-sm120 - 起步仓库:https://github.com/jpezzulli/sglang-rtxpro6000 - 模型检查点:https://huggingface.co/RadixArk/Qwen3.8-Flash-Next-NVFP4 如果你有让它跑得更快的想法,欢迎提出额外的技巧来测试 :) 测试配置: - Ryzen 9 3950x(16核32线程) - 128GB 内存 @3600(存放 ngram 表) - 1x rtx 6000 pro maxq