← 返回信息流
论文 Reddit-LocalLLaMA · /u/serige 2026-08-29 23:18 🔥 热度 2

在2x DGX Spark配置下对Deepseek V4 Flash 0731与GLM5.3 Flash进行Humaneval基准测试

DeepSeek V4与GLM5.3性能对比

原文:Humaneval benchmark for Deepseek V4 Flash 0731 vs GLM5.3 Flash on 2x DGX Spark setup

我最近有一套2个DGX Spark的配置,并且一直在愉快地运行Deepseek V4 Flash 0731。由于本周GLM5.3 Flash和Qwen 3.8 Flash Next的发布,很多人仍在等待,看看根据他们自己的硬件情况应该运行哪个模型。我非常有兴趣在本地运行GLM模型,看起来nvfp4对我的配置来说是一个不错的选择,但我听到了很多关于GLM5.3 Flash在nvfp4量化上的负面意见,这让我犹豫了。所以我决定自己做一个简单的基准测试,希望这对有相同配置的人有用:Deepseek V4 Flash 0731配置:官方检查点,fp8 kv,100万上下文,4个并发流 GLM 5.3 Flash配置:NVFP4量化 & Dflash2草稿,fp8_e4m3 kv,25.6万上下文,6C模型思考模式 HumanEval Pass@1(基础) HumanEval+(对抗性边缘案例) 总基准运行时间 本地流速度 GLM-5.3-Flash NVFP4 思考启用(高) 97.0%(159/164) 92.1%(151/164) 20分52秒 约50 tok/s(DFlash2) DeepSeek-V4-Flash-0731 思考启用(高) 94.5%(155/164) 88.4%(145/164) 38分16秒 约70 tok/s(MTP-5) GLM-5.3-Flash NVFP4 直接零样本(关闭) 93.3%(153/164) 89.6%(147/164) 23分32秒 约50 tok/s(DFlash2) DeepSeek-V4-Flash-0731 直接零样本(关闭) 92.7%(152/164) 87.8%(144/164) 14分52秒 约70 tok/s(MTP-5) 所以原始数据告诉你,GLM 5.3f在各个方面都是对DSv4f 0731的一个不错的升级,特别是启用了思考模式。Unsloth声称他们的Q4量化大约有92%的准确率,但看起来nvfp4仍然表现得相当好(97%的分数在不久前将是SOTA分数,而这还不是最大思考模式)。主要的权衡是256的上下文。我很确定拥有512GB+ VRAM(或4个火花)的人将能够毫无问题地运行fp8模型+100万上下文,我对此感到嫉妒🥹 无论如何,你自己的经验比任何基准测试都重要。

查看原文 ↗ 技术论文

📌 相关阅读

专刊征稿——大模型赋能智慧农业应用 热度 8 MIT最新研究显示:AI文明可能根本不需要语 热度 8 如果禁用 H-Neurons,Qwen3.8-27B 或 GLM-5.3-Flash 这类模型会变得多差? 热度 7 智能体适应度函数:将演进式架构扩展至确定性规则之外 热度 7 演讲:在边缘运行 AI——直接在浏览器中运行真实工作负载 热度 6