← 返回信息流
模型 Reddit-LocalLLaMA · /u/koc_Z3 2026-08-29 06:11 🔥 热度 1

在Apple Silicon上Qwen3.8 27B的速度提升约2倍

Qwen3.8 27B在Apple Silicon上速度提升2倍

原文:~ 2x Speed Boost for Qwen3.8 27B on Apple Silicon

https://x.com/koc_z3/status/2093581036756025744?s=46 在Apple Silicon上Qwen3.8 27B的速度提升约2倍 在Apple Silicon上Qwen3.6 35B AЗB的速度提升约1.5倍 在配备64GB内存的M1 Max Mac上使用MTPLX进行测试,上下文长度为262K(MAX)。Qwen3.8-27B (Q4): - 解码约21 TPS - 预填充约83 TPS(峰值111 TPS) Qwen3.6-35B-A3B (Q4): - 解码约55 TPS - 预填充约300 TPS(峰值623 TPS) 该框架的三个关键功能:与基础模型相比,验证本地生成速度增加了约2倍。自动调优:根据您特定的芯片、热性能和内存带宽确定最佳MTP草稿深度。基础转换:将标准基础模型转换为MLX就绪的MTP模型。仓库:github.com/youssofal/MTPLX 由/u/koc_Z3提交 [链接] [评论]

🖼 相关图片

查看原文 ↗ 大模型发布

📌 相关阅读

腾讯混元4提前发布即提价, AI 收入兑现才刚开始 热度 9 如何打破求学阻碍? Gemma 4开放 大模型 助力视障学子与法学辩手跨越知识高墙! 热度 8 Qwen 3.8 Flash 目前在推理(llama.cpp)方面的现状如何? 热度 8 「GPT-6」灰测demo刷屏!周四发布在即 热度 7 快来给 Qwen 3.8 投票 热度 6