← 返回信息流
产品 Reddit-LocalLLaMA · /u/memeka 2026-08-30 05:54 🔥 热度 2

Qwen3.8-Flash-Next 针对 Macs 优化

优化Qwen3.8-Flash-Next以适应Mac设备

原文:Qwen3.8-Flash-Next optimised for Macs

编辑:在上述测试中,我忘记启用另一个优化 - 当内存和缓存较小时非常有用。当关闭 MTP 时,它对我的数字没有帮助(因为我可以缓存足够的张量),但当打开 MTP 时,我仍然可以达到 185-190 tps 预填充,基本上使 MTP 成为默认选择,没有缺点。这可能也是因为 190 tps 预填充可能是硬件限制。稍后在所有测试完成后,我会添加一个评论,包括 256K 上下文。在 M1 Max 64 GB 上运行:- 张量 SSD 流式传输 - 词素 SSD 流式传输 - MTP SSD 流式传输 这是怎么可能的? 自定义 Q4 量化:在所有金属张量上进行了基准测试,然后从多个 Unsloth 和 AtomicChat 量化中挑选并拼接张量以实现最佳性能/位。 开发了自定义金属优化的稀疏注意力机制,几乎是线性衰减,而不是标准的 llama.cpp 二次注意力。 使用 Q4_0 MTP - 与 unsloth Q8_0 相同的接受率,但内存减半。 动态 MTP 推测大小 - 在上下文大小使 MTP 变为负面的点导致禁用 MTP。* 对金属内核、qwen 图和 qwen 索引器的各种修复。https://github.com/mihailescu2m/llama.cpp 特别感谢 Claude - 三周的代币和一些额外的自付费用信用使这一切成为可能。反馈很受欢迎。注意:启用 MTP 使用更多内存,这意味着张量缓存更少,导致预填充从 180 tps 下降到 170 tps(在 4K)。对于 256K 上下文,需要更多内存用于 KV 缓存,预填充下降到 150 tps。但使用 MTP,解码增益 +70%,上升到 22 btps。所以如果你需要最高的预填充,禁用 MTP。提交者 /u/memeka [链接] [评论]

🖼 相关图片

查看原文 ↗ 产品应用

📌 相关阅读

小度智能屏X10Ultra文心 大模型AI 智能音箱音响10.1英寸 热度 9 babycare小丑鸭AI智能玩具儿童互动陪伴毛绒智能机器人故事 热度 9 钉钉talka1智能AI录音卡同声传译录音转文字录音笔AI分析总 热度 9 美的(Midea)小滋味2.0微烤炸一体机彩膜触控变频平板顶部烤 热度 9 作业帮T60学习机的AI贴身家教这么牛?现在的学习机都进化成这样了吗#作业帮T60 #学习机 #AI (1) 热度 9