Qwen3.8-Flash-Next在单张96GB显卡上支持170K上下文
原文:Qwen3.8-Flash-Next at 170K context on a single 96 GB card. ~110 tok/s.
我使用了量化的 n-gram 到 INT4,它是 32 GB,从磁盘上内存映射。我确认它在 150-160k 上下文上运行良好,并且我在进行单线程长视野任务时一直在观察我的 VRAM 使用情况 - 可用的 VRAM 应该足够将其推到超过 170k 及以上。质量就在那里,伙计们...它确实存在。它制作了一些复杂的 html 游戏,并且它自己找到了在没有浏览器的情况下玩它们的方法(我的 ubuntu 机器没有任何图形界面),并且它不断改进和提高......我们开始吧:hf download primitive-ai/Qwen3.8-Flash-Next-NVFP4 \ --exclude "ple-bf16-" --local-dir ./flash-next cd flash-next hf download primitive-ai/Qwen3.8-Flash-Next-PLE-quant \ --include "ples_int4/" --local-dir . hf download primitive-ai/Qwen3.8-Flash-Next-PLE-quant \ worker_image_quant.py ple_layer_quant.py --local-dir . 跳过 ple-bf16-*(节省 100 GB 但破坏了索引。所以我们修剪该索引):import json p='model.safetensors.index.json'; d=json.load(open(p)); wm=d['weight_map'] drop=[k for k,v in wm.items() if v.startswith('ple-bf16-')] assert len(drop)==128 and all('ngram_embedding' in k for k in drop) for k in drop: del wm[k] json.dump(d, open(p,'w')) 我的意图是将 n-grams 装进我的 64Gb 内存中,但最终,n-grams 和专家 + kvcache 都生活在 GPU 的 VRAM 中,而且它很快!单流 76–125 tok/s。MTP 接受范围:代码和 JSON 上约 87%,仅聊天时约 40%。前缀缓存在长视野任务上达到 90%+。约 89 GB VRAM,约 33 GB 页缓存,165-170K 上下文,一个 GPU。这是我的完整 k0s yaml 文件(带有单个 Pro 6000 的单服务器)。我在我单节点的 k0s 上运行它,这是我的 yaml(cuda 13/580,ubuntu 24.04 无图形界面):apiVersion: apps/v1 kind: Deployment metadata: name: vllm-qwen38-flash-next namespace: default spec: replicas: 1 strategy: type: Recreate # never two of these on one GPU selector: matchLabels: app: vllm-qwen38-flash-next template: metadata: labels: app: vllm-qwen38-flash-nex