← 返回信息流
开源 Reddit-LocalLLaMA · /u/whiteh4cker 2026-08-31 20:57 🔥 热度 3

警告:llama.cpp 的 --lazy-mode 默认值改为 auto,大型表格可能会留在磁盘上

llama.cpp懒加载默认值改为auto,大表可能留在磁盘

原文:Warning: llama.cpp --lazy-mode default changed to auto - large tables may stay on disk

在 b10726 版本中,--lazy-mode 默认值的更改使 Qwen 3.8 Flash Next 的 51B 参数 PLE n-gram 嵌入表保留在磁盘上:它通过 mmap 映射,推理时按需读取其行,即使使用 --load-mode none 也是如此。除非传入 --lazy-mode off,否则它不再被加载进内存。这个更改导致我的 pp 速度下降 50%,token 生成速度下降 15%。如果你像我一样有足够的内存,请务必加上 --lazy-mode off 参数。

查看原文 ↗ 开源项目

📌 相关阅读

我们拆解了 1.1 万个 DeepSeek Harness 插件,发现官方几乎没有建立插件治理机制 热度 15 【开源】Human-Agent-Society/reef:面向自我改进智能体的持续学习基础设施 热度 12 [开源] zeroa234/ryza-ai-revive: Offline fan-made Ryza AI companion. Bring your own LLM/TTS. 离线同人莱莎 AI 陪伴,自填大模型与语 热度 10 【开源】neuronto/agentic-resource-discovery:Neuronto 智能体资源发现(ARD)索引 热度 10 【开源】carloslfu/slotstream:用远低于所需的内存在 Mac 上运行 Qwen3.8-Flash-Next 热度 9