在线 3bit 反量化让 27B 模型在 A6000 跑到 24 TPS
cephaloform · x · 2026-07-29
在线 3bit 反量化把 27B 模型跑到 24 TPS
这条帖子在讨论把更大的模型通过在线反量化变得可训练、可用。作者说自己在 4B 和 9B 规模上已经有不错结果,回复里进一步说明:他们正在尝试让一个 27B 模型通过 on-the-fly 3bit dequant 变得适合做 RL。
- 目前速度已经做到 24 TPS。
- 运行在一块 A6000 上,并且因为散热不佳,只能限制到 100W。
- 核心思路是用更激进的量化/反量化手段,把大模型的 RL 训练门槛压下来。
所属事件:A6000单卡实现27B大模型3bit动态反量化(2 条相关)→
「Infra」频道最新
- 退役 NVIDIA 老卡拼出约 165 美元本地 AI 服务器 — blelbach · 2026-07-29
- Cradle Codec:GPU 原生 KV Cache 压缩技术解析 — knowrohit07 · 2026-07-29
- 廉价本地智能将把 AI 工作负载从云端分流 — PeterDiamandis · 2026-07-29
- AI 开支与推理需求扩张,AMD 利润被看多 10 倍 — AccBalanced · 2026-07-29
- Cradle Codec 把 KV cache 压缩后经以太网跨节点传输 — knowrohit07 · 2026-07-29
- Bittensor 将 q 提至 0.75,放松中游 subnet 的发放门槛 — markjeffrey · 2026-07-29