← 返回信息流
论文 Reddit-LocalLLaMA · /u/trashacct383 2026-08-31 01:09 🔥 热度 5

Qwen3.8-Flash-Next-NVFP4 与 Qwen3.8-27B-FP8 测试结果

Qwen3.8量化模型对比测试结果发布

原文:Qwen3.8-Flash-Next-NVFP4 vs Qwen3.8-27B-FP Test Results

Qwen3.8-Flash-Next-NVFP4 (inferact) vs Qwen3.8-27B-FP8 (qwen) 忙得不可开交,没时间把这篇整理得漂亮些。其中大部分内容是Qwen写的,但我核对过数据。所有测试均在同一台机器、相同提示词下进行,且大部分测试使用的是我的真实工作负载。单卡本地评测环境:一块 RTX PRO 6000 Blackwell Max-Q(96 GB,SM120)+ 256 GB DDR5,vLLM nightly 版本,两个模型交替以相同的服务别名和端口对外提供,供我的Agent技术栈实际调用:文本评分流水线、记忆整合、本地深度研究、浏览器自动化等。少量编码任务。由于下游消费者通过别名进行调用,切换别名背后的模型是找出“哪些环节会出问题”的最真实方法。测试模型:- Qwen3.8-Flash-Next-NVFP4 ( https://huggingface.co/Inferact/Qwen3.8-Flash-Next-NVFP4 ) - Qwen3.8-27B-FP8 ( https://huggingface.co/Qwen/Qwen3.8-27B-FP8 )。以下每一个提示词、测试数据和评分器在两轮测试中完全一致——唯一不同的是所服务的模型。TL;DR: Flash-Next 更快且在机制上无懈可击(严格JSON、抗注入、SLA:全部零失败),并在高推理空间/代码生成层级中胜出,失败模式更优。稠密27B模型在持续多步符号任务(修bug、数学证明、抽象谜题)上仍然占优,而这正是Flash-Next表现出一种显著新失败形态的地方:它承诺交付成果、宣布“完成”,却什么都不输出。同样的 reasoning_effort 参数,语义却截然不同。这不是即插即用的替代品,而是一种有条件的升级。## 部署配置(我实际运行的命令)Flash-Next: ``` docker run vllm/vllm-openai:qwen38-flash-next \ -e VLLM_PLE_CPU_OFFLOAD=1 \ # 将约100GB的n-gram嵌入表放置在主机内存中 -e VLLM_API_KEY=** \ --entrypoint vllm serve Inferact/Qwen3.8-Flash-Next-NVFP4 \ --max-model-len 200704 \ # 约200K(原生262K) --gpu-memory-utilization 0.91 \ --max-num-seqs 16 \ # 延迟优先的单工作站 --no-enable-flashinfer-autotune # 混合注意力路径自行选择后端

查看原文 ↗ 技术论文

📌 相关阅读

MIT最新研究显示:AI文明可能根本不需要语 热度 8 专刊征稿——大模型赋能智慧农业应用 热度 8 如果禁用 H-Neurons,Qwen3.8-27B 或 GLM-5.3-Flash 这类模型会变得多差? 热度 7 智能体适应度函数:将演进式架构扩展至确定性规则之外 热度 7 演讲:在边缘运行 AI——直接在浏览器中运行真实工作负载 热度 6