网友讨论V100与5060ti 16GB跑Qwen3.8配置选择
原文:1x32GB V100 vs 2x16GB V100 vs 5060ti 16GB for QWEN 3.8
大家好,我目前正在考虑从 5060 Ti 16GB 升级。目前用 Qwen 3.8 IQ3_S HF 量化版本在 130k 上下文下能跑出约 40 t/s 的速度。我在 Linux 上运行 llama.cpp。目标是扩大上下文长度、使用更好的量化版本,同时把 5060 腾出来做其他任务。我在考虑的选项是单卡 32GB V100 和双卡 16GB V100。理论上,由于显存带宽更高,双卡 16GB 的性能应该优于 5060 和单卡 32GB。我需要解决的一个问题是 CPU 与 GPU 之间的通信受限——我只有两条 x4 通道可用。在同价位区间还有其他好选择吗?更新:找到了一个很有意思的页面,展示了多张 V100 跑 Qwen 3.8 的性能数据:https://domoticx.net/docs/llm-with-lama.cpp