llama.cpp 调优实录:本地跑 Qwen MoE 提速,附补丁与复现指南

Aelexi93 · reddit · 2026-09-18

开发者用 Astra 驱动长达数小时的 llama.cpp 优化实验,目标是在不改动模型权重和量化的前提下加速本地 MoE 推理,对象为 Qwen3.6-35B-A3B 与 Qwen3.8 Flash-Next。硬件为 RTX 4080(16GB 显存)+ Ryzen 9 5900X + 64GB DDR4。

部分工作负载取得显著提升,尤其是 prompt 处理与源码编辑场景;也存在回退与权衡,均已与结果一并记录。测试包含正确性检查,但不能证明所有任务质量完全不变。作者在 GitHub(Abzolute1/llama-cpp-optimization-lab)开放了源码补丁、benchmark 汇总和复现指南,欢迎独立复现(尤其是不同硬件),也可以直接把仓库交给自己的编码 agent 阅读。便携干净构建路线尚待端到端验证。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →