← 返回信息流
观点 Reddit-LocalLLaMA · /u/Hannibalj2ca 2026-08-31 04:38 🔥 热度 5

用 GLM 5.3、GLM 5.3 Flash 还是 3.8 Qwen Flash 来替换 Kimi k3 IQ2_XXS?

讨论用GLM 5.3或Qwen Flash替代Kimi本地部署

原文:GLM 5.3, GLM 5.3 Flash or 3.8 Qwen Flash for Replacing Kimi k3 IQ2_XXS

Kimi 在 IQ2_xxs 量化下表现似乎还行,但速度很慢,只有 4 tokens/s(勉强能用),有时还会掉到 2 tokens/s(这就很不行了),看起来不太可行。新的 GLM 系列,或者 Qwen Flash 会不会是不错的替代选择?尤其是希望在拥有高智能水平的同时获得更好的交互体验。由 /u/Hannibalj2ca 提交

查看原文 ↗ 观点声音

📌 相关阅读

Hugging Face 被黑事件或暴露 OpenAI 的文化问题 热度 9 为什么 AI Token 如此昂贵 热度 9 学术棱镜 | 大模型不是在“赋能”产业链,是在“重写”它的底层代码 热度 9 【a16z Show】 AI 需求为何超过算力供应 | Why AI Demand Is Outrunning Compute Supply | 双语 热度 9 大模型技术介绍:看懂原理、边界与用法,从此不被"颠覆"话术忽悠 热度 8