llama.cpp 发布 v0.4.0:新增 Qwen3.8-Flash-Next 与稀疏注意力大更新
solyarisoftware · x · 2026-09-05
llama.cpp 发布 v0.4.0 版本,主要更新包括:
- 初始支持 Qwen3.8-Flash-Next(qwen4exp)架构与 NVIDIA Nemotron-3-Puzzle-75B-A9B 模型
- 新增 llamalazymode 懒加载张量按需读取
- 服务端支持 per-slot 上下文上限
- 多模态侧新增视频输入选项与 mtmdtokenizefromparts() 等 API
- ggml 升级到 0.23.0,带来大规模稀疏 flash attention 与 RDMA 支持
另有会话/KV 状态版本更新与量化参数 maxbufsize 等 API 变更。
「Infra」频道最新
- ZenMux 推出 API 聚合服务:自动故障切换,幻觉输出可返积分 — testingcatalog · 2026-09-05
- GPU 藏在衣柜、面板装口袋:ModelDeck 把本地多模型推理搬进手机 — EAccelerate_42 · 2026-09-05
- 放弃租 GPU:一台 121GiB 小主机跑满全家桶本地模型 — EAccelerate_42 · 2026-09-05
- 一行代码提升 PyTorch 速度:set_float32_matmul_precision 值得设置 — code_star · 2026-09-05
- Nvidia 发布 PAIR:把闲置 PC 和 Mac 变成本地 AI 算力 — emmanuelvivier · 2026-09-05
- Stripe 据称以超 70 亿美元收购 AI 模型路由器 OpenRouter — emmanuelvivier · 2026-09-05