llama.cpp优化CPU和混合推理性能
原文:llama.cpp Open PRs list - CPU/RAM/Disk/Hybrid Related - Better for CPU-only & Hybrid inference
各位!我们距离更快的推理仅差50个PR。希望在今年年底前完成。各位专家,请积极参与。CPU/RAM/磁盘/混合相关的开放/进行中PR列表(以及讨论):[讨论] RFC:MoE专家缓存,使用混合命中/未命中执行对热CPU驻留专家的VRAM缓存 #24528 AVX2:加速IQ模型的大批量提示处理 #27402 llama:添加Maple 20B-A1B三元MoE架构(CPU)- #27000 ggml-cpu:整数乘法矩阵用于k-量化- #27851 ggml-cpu:添加AVX-512和VNNI路径用于Q5_K/Q6_K点积- #27590 ggml-cpu:添加x86 VNNI Q2_0点积 -- 对VNNI兼容CPU的速度提升3倍- #26348 llama:添加pshard运行时用于计划切换和流式权重- #22692 CPU优化 - 预填充、标记化和标记生成- #27032 llama:从磁盘流式MoE路由专家 - #25294 ggml:加速单批次CPU解码,对齐大分配- #27478 杂项:防止模型加载阶段RAM峰值- #27483 循环:支持循环状态回滚的等分- #25004 ggml-cpu:添加AVX2 vec_dot内核用于STQ1_0- #27377 --numa镜像:将模型权重镜像到系统中的每个Numa节点- #16000 CPU flash-attn:支持预填充内核中的量化K/V- #26948 ggml-cpu/amx:修复block_q8_K VNNI量化并启用VNNI路径- #27024 服务器:添加/slots端点操作=clone_to(插槽之间的KV克隆)- #26204 ggml:将soft_max扫描融合到更少的通道中- #26468 ggml-cpu:添加STQ1_0三元量化与ARM NEON vec_dot内核- #22836 llama-hot-experts:通过--pin-hot-experts将最热的MoE专家固定在RAM中- #26414 llama:为大于RAM的MoE模型添加--lazy-experts- #26003 ggml:向量化rms_norm减少并融合比例写入- #26486 MoE磁盘卸载用于Metal- #23440 ggml-cpu:添加RVV VLEN=1024向量点积(vec_dot)内核用于量化类型- #25397 ggml-cpu:在MSVC本地构建中检测AVX-VNNI- #25346 ggml-cpu:用