NInfer Fork支持Qwen-3.8 27B双GPU推理
原文:(NInfer Fork) I wanted to have a 1M context Qwen-3.8 27B, tp2, dual 5090s
大家好!我fork了NInfer(一个从头开始编写的C++20/CUDA推理引擎,支持Qwen模型),并添加了两项功能:跨两张GPU的tensor并行计算,以及YaRN ×4 rope scaling。这两项功能使得Qwen3.8-27B NVFP4能够在两张消费级5090显卡上运行1,048,576-token的上下文窗口——每张卡27.4 GB,无需NVLink。性能数据(单流,每张GPU功耗上限500 W):在653k上下文窗口下解码:使用MTP推测解码时为119 tok/s,不使用时为57 tok/s。在相同提示下,vLLM的解码速度为42 tok/s。原因:在超过其原生262k窗口后,vLLM的MTP接受率降至零(1533个草稿中0个被接受)——它一直在为草稿者付费。NInfer的接受率在100万范围内保持在约55-60%。预填充是vLLM的优势:比NInfer快1.2-1.3倍。在NInfer上处理完整的100万token提示大约需要18分钟。这是未经优化的部分。在100万token时:解码速度为48 tok/s,使用MTP时约为100 tok/s。vLLM的fp8 KV缓存在这款硬件上最多可容纳约759k token;NInfer的INT8 KV缓存占用更少内存即可容纳1,048,576 token。两张GPU也比一张快:在250k时为75 vs 54 tok/s,因为每张卡的权重和KV流量减半,而每token约128次跨GPU归约在CUDA图下仅需约0.2 ms。性能提交者/u/Littlepharaoh [链接] [评论]