1.375 bits/权重的 3:4 三值格式跑进浏览器:1.6MB 模型打平 7.8MB int8
Brilliant-Hall1387 · reddit · 2026-09-30
Precisit 团队将 Sherry 式 3:4 三值权重格式(T34:每 4 个权重中 1 个为 0、3 个为 ±1,4 个权重塞进 5 bit,约 1.375 bits/权重)跑在浏览器 WebGPU 上,模型仅 1.59MB,下五子棋表现与 7.8MB int8 版本相当,单步推理 1.1ms(M5 Pro)。
200 局对战中,从头训练的 T34 对 depth-4/depth-6 bot 胜率 0.93/0.91,而训练完再转换成 T34 的版本直接崩到 0.13——说明该格式必须在前向传播中参与训练,不能后处理转换。
其他发现:attention 的 q/k/v 矩阵最敏感;group size(64/128/256)影响很小;同配方不同 seed 结果差异大(0.945 vs 0.882)。代码、模型与文章均 MIT 开源,提供在线 demo。
「Infra」频道最新
- OpenRouter 数据简报:token 用量爆发,开源模型支出半年涨 10 倍 — AccBalanced · 2026-09-30
- 观点:AI 算力不该全锁给大客户,要给初创留成长空间 — AccBalanced · 2026-09-30
- Ollama 0.35 发布:Mac 本地跑 Nimble 模型 — Technovangelist · 2026-09-30
- 黄仁勋:数据中心现在应改称「超级智能工厂」 — Polymarket · 2026-09-30
- AI 生成推理引擎实测:小米模型跑出 1300+ tok/s,称 AlphaGo 时刻 — bingxu_ · 2026-09-30
- AMD 讲解用 AI agent 通宵自动调优 GPU 内核性能 — AnushElangovan · 2026-09-30