社区用数个晚上追平闭源方案:llama.cpp 上跑出 1.2k t/s Qwen 预填充

ilintar · reddit · 2026-09-13

Reddit 用户在 AMD Strix Halo 上将主线 llama.cpp 的 Qwen3.8 Flash Next 预填充速度从社区 fork 的约 400 t/s 提升到 1200 t/s,追平了闭源推理服务 Halogen 宣称的成绩:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →