llama.cpp 合入 hc 算子优化 Qwen4exp,可重新跑分
jacek2023 · reddit · 2026-09-16
llama.cpp 的 qwen4exp 分支合入 PR #28901,由 am17an 添加 hc 算子(hc ops),发帖人提示是时候对 Qwen Flash Next 重新跑基准了。该改动可能改善相关模型的推理速度,关注本地推理性能的用户可重测。
「Infra」频道最新
- 面向 8GB 级设备的开源小模型榜单:SmolLM2-135M 达 165 tok/s、29.6 tok/J — East-Muffin-6472 · 2026-09-16
- Ministral 3 3B 纯 CPU 跑在 Galaxy S21 上,10 次全成跨双浏览器转发对话 — Mean-Standard7390 · 2026-09-16
- 本地跑 Qwen 35B:32GB Mac 提示词处理慢至 20 分钟求升级方案 — Guilty-Support-584 · 2026-09-16
- 腾讯开源 BrowserSkill:让 AI Agent 复用你已登录的真实浏览器 — AIFlow_ML · 2026-09-16
- 先存全部历史再按需构建视图:数据湖仓式上下文基础设施模式浮现 — blaizedsouza · 2026-09-16
- Lumentum:FDA 光学进入 30 年最大拐点,光互联将成算力引擎一部分 — pstAsiatech · 2026-09-16