← 返回信息流
开源 Reddit-LocalLLaMA · /u/jacek2023 2026-08-31 11:50 🔥 热度 6

CUDA:将 MOE 融合扩展到 specdec,此前 MOE glu 融合和 topk-router 融合仅限单 token|ynankani 的 Pull Request #27621 · ggml-org/llama.cpp

CUDA扩展MoE融合至投机解码,提升推理速度

原文:CUDA: extend MOE fusion to specdec, earlier MOE glu fusion and topk-router fusion were restricted to 1 token by ynankani · Pull Request #27621 · ggml-org/llama.cpp

我还没来得及测试,但看起来非常有前景。它似乎能在不同的 draft 宽度下加速 MoE 模型的 MTP(尤其是宽度大于 1 时)。可以查看其中的基准测试。

🖼 相关图片

查看原文 ↗ 开源项目

📌 相关阅读

[开源] Laffey-82/OFbot2: 可扩展的插件化 QQ 机器人框架:多协议多账号、逐群功能开关、Web 管理后台与插件市场 热度 12 【开源】Morningstar202604/VerdictAI:多智能体法庭辩论与判决系统 热度 10 【开源】AMAP-ML/LoopArena:将模型作为运行时控制器进行循环工程基准测试 热度 9 【开源】franklil0401/proofpick_agent:基于 ReAct 的 Agentic RAG 消费决策智能体 热度 9 三块钱两小时训出你自己的人工智能|GitHub 每日 AI 项目推荐 EP.030 热度 9