Qwen3.8-Next流式处理性能提升
原文:Qwen3.8-Next streaming - 150tps prefill, 3.6 tps decode on M5 Air
出于好奇,我想看看是否可以将几周前开发的DSv4流式处理栈适配到Qwen3.8-Next。结果证明是可行的,甚至比我预期的还要好——实际上在我的32GB M5上运行得比密集型27b模型还要快(当然这并不是完全等同的比较,因为我决定使用MoE的3bit版本,即Qwen3.8-Flash-Next-MLX-oQ3-MTP,而密集型模型是4bit的)。对于一个2k token的提示,在我的M5上使用低功耗模式,3.8-Next-3bit实现了每秒150个token的预填充和3.6个token的解码。27b-4bit模型实现了每秒70个token的预填充和3个token的解码 - 由u/maddie-lovelace提交 [链接] [评论]