← 返回信息流
模型 Reddit-LocalLLaMA · /u/ethertype 2026-08-30 11:16 🔥 热度 3

Qwen 3.8 Flash Next Q6_K_XL 在 4 张 3090 上成功加载

Qwen 3.8 Flash Next Q6_K_XL在4个3090上运行测试

原文:Qwen 3.8 Flash Next Q6_K_XL loads OK on 4 x 3090.

速度为 22 tk/s。(相比之下,Q4_K_XL 的速度为 47 tk/s)未进行广泛测试。为了避免内存不足,需要稍微限制上下文长度(200k)。没有迭代以找到最佳/最大配置。在我的系统上,--load-mode none 速度提升了 0.5 tk/s,因为 64GB 内存和 32GB 交换空间(NVME 上的)几乎占用了 100%。因此使用 mmap。没有特意使用 KV 量化。我预计 Qwen 3.8 FN 的 MTP 会在某个时间点合并到上游。我知道 quimmedes/Qwen3.8-Flash-Next-MTP-GGUF,但今天我可能已经在这上面花了太多时间了。我可能会继续使用 27B_Q8 作为我的日常驱动,但很高兴知道如果需要的话我有一个更强大的工具。我目前在硬件上使用的 Qwen3.8-Flash-Next-UD-Q6_K_XL 的脚本如下:#!/bin/sh #export MMPROJ=~/models/qwen3.8-flash-next/mmproj-F16.gguf export MODEL=~/models/qwen3.8-flash-next/UD-Q6_K_XL/Qwen3.8-Flash-Next-UD-Q6_K_XL-00001-of-00006.gguf export TEMPLATE=/home/ethertype/models/chat_template_froggeric_22.3.jinja ./build/bin/llama-server \ --model $MODEL \ --verbosity 4 \ --threads -1 \ --parallel 4 \ --kv-unified \ --split-mode layer \ --fit on \ --load-mode mmap \ --ctx-size 200000 \ --slot-save-path ~/.kvcache \ --flash-attn on \ --spec-type ngram-mod \ --spec-draft-n-max 3 \ --batch-size 2048 --ubatch-size 512 \ --device CUDA0,CUDA1,CUDA2,CUDA3 \ --temp 1.0 \ --top-p 0.95 \ --top-k 20 \ --min-p 0.0 \ --presence-penalty 1.5 \ --repeat-penalty 1.0 \ --alias "qwen3.8-flash-next" \ --host 0.0.0.0 \ --port 5001 \ --reasoning-preserve \ --reasoning on \ --chat-template-kwargs '{"preserve_thinking":"true"}' \ --jinja \ --chat-template-file $TEMPLATE 由 /u/ethertype 提交 [链接] [评论]

查看原文 ↗ 多模态

📌 相关阅读

如何让非遗对话?基于 Gemma 4开放 大模型 ,画剪纸、舞唐俑、诵古诗,让传统活在当下! 热度 9 非遗如何能有新生机?基于 Gemma 4开放 大模型 ,手绘剪纸、隔空舞唐俑、读诗唤风雪! 热度 9 Runway 推出首款界面世界模型 Solaris 热度 6 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp · Hugging Face 热度 6 中国首部AIGC长剧《西游记后传》今日首播,同时也是首部“边审边播”的剧集 热度 6