← 返回信息流
论文 Reddit-LocalLLaMA · /u/Littlepharaoh 2026-08-29 18:24 🔥 热度 2

(NInfer分支) 我希望拥有一个支持100万上下文窗口的Qwen-3.8 27B模型,使用tp2和双5090显卡

NInfer Fork支持Qwen-3.8 27B双GPU推理

原文:(NInfer Fork) I wanted to have a 1M context Qwen-3.8 27B, tp2, dual 5090s

大家好!我fork了NInfer(一个从头开始编写的C++20/CUDA推理引擎,支持Qwen模型),并添加了两项功能:跨两张GPU的tensor并行计算,以及YaRN ×4 rope scaling。这两项功能使得Qwen3.8-27B NVFP4能够在两张消费级5090显卡上运行1,048,576-token的上下文窗口——每张卡27.4 GB,无需NVLink。性能数据(单流,每张GPU功耗上限500 W):在653k上下文窗口下解码:使用MTP推测解码时为119 tok/s,不使用时为57 tok/s。在相同提示下,vLLM的解码速度为42 tok/s。原因:在超过其原生262k窗口后,vLLM的MTP接受率降至零(1533个草稿中0个被接受)——它一直在为草稿者付费。NInfer的接受率在100万范围内保持在约55-60%。预填充是vLLM的优势:比NInfer快1.2-1.3倍。在NInfer上处理完整的100万token提示大约需要18分钟。这是未经优化的部分。在100万token时:解码速度为48 tok/s,使用MTP时约为100 tok/s。vLLM的fp8 KV缓存在这款硬件上最多可容纳约759k token;NInfer的INT8 KV缓存占用更少内存即可容纳1,048,576 token。两张GPU也比一张快:在250k时为75 vs 54 tok/s,因为每张卡的权重和KV流量减半,而每token约128次跨GPU归约在CUDA图下仅需约0.2 ms。性能提交者/u/Littlepharaoh [链接] [评论]

🖼 相关图片

查看原文 ↗ 技术论文

📌 相关阅读

专刊征稿——大模型赋能智慧农业应用 热度 8 MIT最新研究显示:AI文明可能根本不需要语 热度 8 如果禁用 H-Neurons,Qwen3.8-27B 或 GLM-5.3-Flash 这类模型会变得多差? 热度 7 智能体适应度函数:将演进式架构扩展至确定性规则之外 热度 7 演讲:在边缘运行 AI——直接在浏览器中运行真实工作负载 热度 6