Laguna 测试 2.75 和 3.25 bpw 量化方案
QuixiAI · x · 2026-07-27
这条帖在分享 Laguna 的 2.75 bpw / 3.25 bpw 量化实验:采用 REAP 方案且不做 pruning。
核心信息包括:
- 保留 23%–30% 的 experts 在 NVFP4
- 其余 experts 采用 EXL3 风格的 2/3 bit 表示
- KV Cache 使用 FP8
作者还提到下一步会把视觉能力接进去,把 2.75 bpw 继续压到 2 bit,并跑 Terminal-bench-2.1、GPQA Diamond、Deepswe? 等基准。
「Infra」频道最新
- 美光与 Meta 白皮书称 Spark 溢写 SSD 后可慢 38 倍 — dr_alphalyrae · 2026-07-27
- AI 推理服务被指比自租 GPU 贵 7 到 15 倍 — JoshPurtell · 2026-07-27
- CUDA 基准测出 6400 万数求和快 20 倍 — ctjlewis · 2026-07-27
- AI 基建把数据中心融资逼进更复杂的资本结构 — GaryMarcus · 2026-07-27
- 有人在问:RAID 0 NVMe 组合能否提升 Pulsar 跑大模型 — Wyldkard79 · 2026-07-27
- GLM-5.2 在 RTX 5090 上推理提速至 80–110 tok/s — markjeffrey · 2026-07-27