Phala 发布 GLM-5.3-W4AFP8 量化版,针对 Agent 优化
bgmshana · x · 2026-09-01
Phala Network 发布了基于 GLM-5.3 BF16 原版构建的量化模型 GLM-5.3-W4AFP8。
技术细节:
- MoE 专家权重使用 group-128 INT4 配合 AWQ 量化。
- 激活值和非专家层使用 FP8。
校准策略:
- 使用来自 SWE-chat 的编码 Agent 轨迹进行校准。
- 专门针对长时程 Agent 工作负载进行对齐优化。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01