Qwen3.8-Flash在llama.cpp上CPU至96GB显存的推理速度实测
原文:Qwen3.8-Flash-Next in llama.cpp from CPU-only to 96GB VRAM: 8.5 to 109 tok/s, max context and parameters test. My findings on RTX 6000 PRO.
大家好,我用 llama.cpp 测试了 Qwen3.8 Flash,从纯 CPU 一直到 RTX PRO 6000 的全部 96GB 显存。简短结论:纯 CPU 在 2K 提示下达到 8.34 tok/s;满 96GB 达到 109.07 tok/s;在 245K 上下文时,24GB 到 96GB 的速度为 14.89 到 21.61 tok/s;96GB 相比 24GB 的优势从 2K 时的 2.80 倍降到 245K 时的 1.45 倍;强制把 27.2 GiB 的 PLE 表放到 CUDA 上后,解码速度从 108.5 降到 1.95 tok/s;常驻 RAM 加载的 prefill 速度比 mmap 高 1.87 倍;非统一 KV 在并发 16 时总输出达到 92.0 tok/s。测试环境:模型 unsloth/Qwen3.8-Flash-Next-GGUF;量化:UD-IQ4_XS;模型大小:87.2 GiB;引擎:llama.cpp b10666,revision 4e97ac86e(Qwen3.8 merge:6c84c7d5d,PR #27742);GPU:NVIDIA RTX PRO 6000 Blackwell,96GB;CPU:AMD Ryzen 9 9950X;系统内存:96GB DDR5;操作系统:Ubuntu;CUDA:CUDA 13。每种配置我都重新启动服务器,等待上一次显存分配释放、GPU 降温。每次运行都保存了最终配置、服务器日志、输出、内存使用和 GPU 遥测数据。关于显存区间的重要说明:所有 GPU 测试均使用同一块 RTX PRO 6000。由于有一个辅助进程占用 GPU 显存,llama.cpp 看到的可用显存池更小。这测试的是显存容量和 CPU 卸载,并不能模拟真实 8GB 或 24GB GPU 的算力或带宽。8GB 的结果不代表所有 8GB 显卡都能达到同样速度。显存测试结果:以下所有数字均使用 2,048 token 提示。纯 CPU:Prefill:182.64 tok/s;Decode:8.34 tok/s。可用显存(专家层留在 RAM 中)——8GB:48 层中 48 层在 RAM,Prefill 232 tok/s,Decode 35.69 tok/s;16GB:48 层中 45 层,249 tok/s,37.93 tok/s;24GB:48 层中 42 层,260 tok/s,39.01 tok/s;32GB:48 层中 36 层,292 tok/s,42.24 tok/s;48GB:48 层中 23 层,746.7 tok/s,51.73 tok/s;96GB:48 层中 0 层,1,955 tok/s,109.07 tok/s。所有 GPU 测试均使用同一块 RTX PRO 6000,容量限制模拟的是显存容量,而非更小 GPU 的性能。