优化Qwen3.8-Flash-Next以适应Mac设备
原文:Qwen3.8-Flash-Next optimised for Macs
编辑:在上述测试中,我忘记启用另一个优化 - 当内存和缓存较小时非常有用。当关闭 MTP 时,它对我的数字没有帮助(因为我可以缓存足够的张量),但当打开 MTP 时,我仍然可以达到 185-190 tps 预填充,基本上使 MTP 成为默认选择,没有缺点。这可能也是因为 190 tps 预填充可能是硬件限制。稍后在所有测试完成后,我会添加一个评论,包括 256K 上下文。在 M1 Max 64 GB 上运行:- 张量 SSD 流式传输 - 词素 SSD 流式传输 - MTP SSD 流式传输 这是怎么可能的? 自定义 Q4 量化:在所有金属张量上进行了基准测试,然后从多个 Unsloth 和 AtomicChat 量化中挑选并拼接张量以实现最佳性能/位。 开发了自定义金属优化的稀疏注意力机制,几乎是线性衰减,而不是标准的 llama.cpp 二次注意力。 使用 Q4_0 MTP - 与 unsloth Q8_0 相同的接受率,但内存减半。 动态 MTP 推测大小 - 在上下文大小使 MTP 变为负面的点导致禁用 MTP。* 对金属内核、qwen 图和 qwen 索引器的各种修复。https://github.com/mihailescu2m/llama.cpp 特别感谢 Claude - 三周的代币和一些额外的自付费用信用使这一切成为可能。反馈很受欢迎。注意:启用 MTP 使用更多内存,这意味着张量缓存更少,导致预填充从 180 tps 下降到 170 tps(在 4K)。对于 256K 上下文,需要更多内存用于 KV 缓存,预填充下降到 150 tps。但使用 MTP,解码增益 +70%,上升到 22 btps。所以如果你需要最高的预填充,禁用 MTP。提交者 /u/memeka [链接] [评论]