llama.cpp v0.6.0 发布:Qwen4Exp 支持 MTP 投机解码
vexatious-big · reddit · 2026-10-06
llama.cpp 发布 v0.6.0,为 Qwen4Exp 带来 MTP(multi-token prediction)投机解码支持,并包含大量其他更新。GitHub release:ggml-org/llama.cpp v0.6.0。
所属事件:llama.cpp v0.6.0 发布:Qwen4Exp 投机解码与 Metal 性能提升(2 条相关)→
「Infra」频道最新
- Beam 首个模型开源:501B-A23B 文本 MoE,Apache 2.0 全栈放发 — brandondamos · 2026-10-06
- Vultr 斥资 12 亿美元订购 AMD Helios AI 机架,客户提前数年锁算力 — shashib · 2026-10-06
- NanoGPT speedrun 刷新纪录:速度提升 11.3%,论文即将发布 — yoavartzi · 2026-10-06
- NVIDIA CANTO:直接从 CAD 参数化曲面预测气动场 — JeanKossaifi · 2026-10-06
- Epoch 估算:2027 年底算力可支撑数亿乃至数十亿 AI 智能体 — Jsevillamol · 2026-10-06
- 单卡 RTX PRO 4500 32GB 跑 188k 上下文,推理速度达 60-67 tok/s — sdfprwggv · 2026-10-06