Qwen 3.8 Flash Next Q6_K_XL在4个3090上运行测试
原文:Qwen 3.8 Flash Next Q6_K_XL loads OK on 4 x 3090.
速度为 22 tk/s。(相比之下,Q4_K_XL 的速度为 47 tk/s)未进行广泛测试。为了避免内存不足,需要稍微限制上下文长度(200k)。没有迭代以找到最佳/最大配置。在我的系统上,--load-mode none 速度提升了 0.5 tk/s,因为 64GB 内存和 32GB 交换空间(NVME 上的)几乎占用了 100%。因此使用 mmap。没有特意使用 KV 量化。我预计 Qwen 3.8 FN 的 MTP 会在某个时间点合并到上游。我知道 quimmedes/Qwen3.8-Flash-Next-MTP-GGUF,但今天我可能已经在这上面花了太多时间了。我可能会继续使用 27B_Q8 作为我的日常驱动,但很高兴知道如果需要的话我有一个更强大的工具。我目前在硬件上使用的 Qwen3.8-Flash-Next-UD-Q6_K_XL 的脚本如下:#!/bin/sh #export MMPROJ=~/models/qwen3.8-flash-next/mmproj-F16.gguf export MODEL=~/models/qwen3.8-flash-next/UD-Q6_K_XL/Qwen3.8-Flash-Next-UD-Q6_K_XL-00001-of-00006.gguf export TEMPLATE=/home/ethertype/models/chat_template_froggeric_22.3.jinja ./build/bin/llama-server \ --model $MODEL \ --verbosity 4 \ --threads -1 \ --parallel 4 \ --kv-unified \ --split-mode layer \ --fit on \ --load-mode mmap \ --ctx-size 200000 \ --slot-save-path ~/.kvcache \ --flash-attn on \ --spec-type ngram-mod \ --spec-draft-n-max 3 \ --batch-size 2048 --ubatch-size 512 \ --device CUDA0,CUDA1,CUDA2,CUDA3 \ --temp 1.0 \ --top-p 0.95 \ --top-k 20 \ --min-p 0.0 \ --presence-penalty 1.5 \ --repeat-penalty 1.0 \ --alias "qwen3.8-flash-next" \ --host 0.0.0.0 \ --port 5001 \ --reasoning-preserve \ --reasoning on \ --chat-template-kwargs '{"preserve_thinking":"true"}' \ --jinja \ --chat-template-file $TEMPLATE 由 /u/ethertype 提交 [链接] [评论]