DeepSeek V4与GLM5.3性能对比
原文:Humaneval benchmark for Deepseek V4 Flash 0731 vs GLM5.3 Flash on 2x DGX Spark setup
我最近有一套2个DGX Spark的配置,并且一直在愉快地运行Deepseek V4 Flash 0731。由于本周GLM5.3 Flash和Qwen 3.8 Flash Next的发布,很多人仍在等待,看看根据他们自己的硬件情况应该运行哪个模型。我非常有兴趣在本地运行GLM模型,看起来nvfp4对我的配置来说是一个不错的选择,但我听到了很多关于GLM5.3 Flash在nvfp4量化上的负面意见,这让我犹豫了。所以我决定自己做一个简单的基准测试,希望这对有相同配置的人有用:Deepseek V4 Flash 0731配置:官方检查点,fp8 kv,100万上下文,4个并发流 GLM 5.3 Flash配置:NVFP4量化 & Dflash2草稿,fp8_e4m3 kv,25.6万上下文,6C模型思考模式 HumanEval Pass@1(基础) HumanEval+(对抗性边缘案例) 总基准运行时间 本地流速度 GLM-5.3-Flash NVFP4 思考启用(高) 97.0%(159/164) 92.1%(151/164) 20分52秒 约50 tok/s(DFlash2) DeepSeek-V4-Flash-0731 思考启用(高) 94.5%(155/164) 88.4%(145/164) 38分16秒 约70 tok/s(MTP-5) GLM-5.3-Flash NVFP4 直接零样本(关闭) 93.3%(153/164) 89.6%(147/164) 23分32秒 约50 tok/s(DFlash2) DeepSeek-V4-Flash-0731 直接零样本(关闭) 92.7%(152/164) 87.8%(144/164) 14分52秒 约70 tok/s(MTP-5) 所以原始数据告诉你,GLM 5.3f在各个方面都是对DSv4f 0731的一个不错的升级,特别是启用了思考模式。Unsloth声称他们的Q4量化大约有92%的准确率,但看起来nvfp4仍然表现得相当好(97%的分数在不久前将是SOTA分数,而这还不是最大思考模式)。主要的权衡是256的上下文。我很确定拥有512GB+ VRAM(或4个火花)的人将能够毫无问题地运行fp8模型+100万上下文,我对此感到嫉妒🥹 无论如何,你自己的经验比任何基准测试都重要。