讨论用GLM 5.3或Qwen Flash替代Kimi本地部署
原文:GLM 5.3, GLM 5.3 Flash or 3.8 Qwen Flash for Replacing Kimi k3 IQ2_XXS
Kimi 在 IQ2_xxs 量化下表现似乎还行,但速度很慢,只有 4 tokens/s(勉强能用),有时还会掉到 2 tokens/s(这就很不行了),看起来不太可行。新的 GLM 系列,或者 Qwen Flash 会不会是不错的替代选择?尤其是希望在拥有高智能水平的同时获得更好的交互体验。由 /u/Hannibalj2ca 提交