llama.cpp新特性太多怎么选?MTP与Dflash加速引热议
RobotRobotWhatDoUSee · reddit · 2026-08-14
随着本地大模型推理技术快速迭代,llama.cpp 引入了大量新特性。发帖者回归本地部署后,对如何利用 MTP、Dflash、Eagle 等新模型和参数来加速推理感到困惑。
作者计划在 Strix Halo 硬件上运行 Gemma4 31B、Qwen 27B 等模型,并向社区求助如何配置这些新出现的命令行参数,以最大化提升模型的推理速度。
「Infra」频道最新
- 日本开发者推出 VRAMDISK:将 GPU 显存化作超高速硬盘 — lxfater · 2026-08-14
- 美光 LTA 协议成供应商门槛,AI 算力供应链缓解无望 — Sethwinterroth · 2026-08-14
- 1300美元组装四卡RTX 3060旧服务器,成功跑128k上下文大模型 — desexmachina · 2026-08-14
- HBM5延迟,HBM4E弃用混合键合,先进封装路线生变 — zephyr_z9 · 2026-08-14
- 单张RTX 3090跑30B模型:W4A16量化实现4.5倍吞吐量提升 — mitchins-au · 2026-08-14
- 硬核优化:纯C语言在8GB内存CPU上跑2.78万亿参数Kimi K3 — AutomaticDriver5882 · 2026-08-14