AMD 上的新量化推理优化
huggingface · x · 2026-07-14
Hugging Face 转发了一条关于 AMD Strix Halo 用户的新模型与量化方案更新。
要点包括:
- 298B 参数模型 Hy3 使用新的 2-bit FPX codebook,目标是更高效映射到 AMD 硬件的 INT8 通道。
- 相比 IQ2M,新量化方案体积小 2.55%。
- 在短编码提示上,端到端无 MTP 延迟约降 2.4%;在 19,654 token 的编码提示上约降 6.2%。
- 可将 14.05GB 可复用状态放到 SSD,而不是占用稀缺的 UMA 缓存内存。
- 未加权控制分数为 HermesAgent-20 的 81 分、Tool-Eval 全量 88 分,作者称超过多数 Qwen 模型。
- 运行速度约 17–25 tok/s,prefill 约 200 tok/s;要吃到这些优化需要最新的 FTX inference-engine(llama fork)更新。
「Infra」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11