← 返回信息流
模型 Reddit-LocalLLaMA · /u/maddie-lovelace 2026-08-29 10:10 🔥 热度 2

Qwen3.8-Next流式处理:在M5 Air上实现每秒150个token的预填充和3.6个token的解码

Qwen3.8-Next流式处理性能提升

原文:Qwen3.8-Next streaming - 150tps prefill, 3.6 tps decode on M5 Air

出于好奇,我想看看是否可以将几周前开发的DSv4流式处理栈适配到Qwen3.8-Next。结果证明是可行的,甚至比我预期的还要好——实际上在我的32GB M5上运行得比密集型27b模型还要快(当然这并不是完全等同的比较,因为我决定使用MoE的3bit版本,即Qwen3.8-Flash-Next-MLX-oQ3-MTP,而密集型模型是4bit的)。对于一个2k token的提示,在我的M5上使用低功耗模式,3.8-Next-3bit实现了每秒150个token的预填充和3.6个token的解码。27b-4bit模型实现了每秒70个token的预填充和3个token的解码 - 由u/maddie-lovelace提交 [链接] [评论]

查看原文 ↗ 大模型发布

📌 相关阅读

腾讯混元4提前发布即提价, AI 收入兑现才刚开始 热度 9 如何打破求学阻碍? Gemma 4开放 大模型 助力视障学子与法学辩手跨越知识高墙! 热度 8 Qwen 3.8 Flash 目前在推理(llama.cpp)方面的现状如何? 热度 8 「GPT-6」灰测demo刷屏!周四发布在即 热度 7 快来给 Qwen 3.8 投票 热度 6