CUDA扩展MoE融合至投机解码,提升推理速度
原文:CUDA: extend MOE fusion to specdec, earlier MOE glu fusion and topk-router fusion were restricted to 1 token by ynankani · Pull Request #27621 · ggml-org/llama.cpp
我还没来得及测试,但看起来非常有前景。它似乎能在不同的 draft 宽度下加速 MoE 模型的 MTP(尤其是宽度大于 1 时)。可以查看其中的基准测试。