开源工具通过SSD流式加载专家,让Mac低内存运行125B大模型
原文:[开源] carloslfu/slotstream: Run Qwen3.8-Flash-Next (125B MoE, 104 GB at 4-bit) on Macs with a fraction of th
通过从 SSD 流式加载专家模块,在 Mac 上以远低于实际所需内存的方式运行 Qwen3.8-Flash-Next(125B MoE,4-bit 下占用 104 GB)。基于 MLX 和 Swift 开发,提供兼容 Ollama 的 API。语言:Swift,Stars:85,创建时间:2026-08-28