社区用数个晚上追平闭源方案:llama.cpp 上跑出 1.2k t/s Qwen 预填充
ilintar · reddit · 2026-09-13
Reddit 用户在 AMD Strix Halo 上将主线 llama.cpp 的 Qwen3.8 Flash Next 预填充速度从社区 fork 的约 400 t/s 提升到 1200 t/s,追平了闭源推理服务 Halogen 宣称的成绩:
- 作者为了不被闭源方案拉开差距,自行调试数晚,写出自定义 HIP runtime 和安装脚本,并附上 Opus 生成的完整优化复盘
- 文章还梳理了主线 llama.cpp、社区 fork 与自定义分支之间的生态关系
- 后续计划整理代码向主线和社区 fork 提交 PR;由于采用了类似的稀疏注意力,这些优化预计也能惠及 GLM 5.3 Flash 架构
「Infra」频道最新
- Yacine 吐槽:Astra 疑似被限流分时供电 — yacineMTB · 2026-09-13
- 内存涨价实锤:32GB VPS 大面积缺货,跑 agent 更难了 — flavioAd · 2026-09-13
- Hugging Face 机器人 Microduck 5 天预售万台,揭秘深圳 Seeed 供应链 — Scobleizer · 2026-09-13
- NVIDIA 每年迭代 AI 工厂架构仅 15 倍 P/E,苹果折叠机概念拿 33 倍 — JFPuget · 2026-09-13
- AMD 显卡跑 MiniMax H3 完整教程:ComfyUI 须升 ROCm 7.13+ — Apprehensive_Sky892 · 2026-09-13
- OpenAI 数据中心落地佐治亚,替居民缴税致房产税降约 30% — surmenok · 2026-09-13