llama.cpp新PR通过AVX2加速CPU大批量提示处理
原文:AVX2: Speed up large batch size prompt processing of IQ models by bartowski1182 · Pull Request #27402 · ggml-org/llama.cpp
Faster prompt processing on CPU. submitted by /u/jacek2023 [link] [comments]