玩家自制 RCO-lite 动态量化:一半 KLD 误差,比 IQ3_M 还小 52MB
jjusko20 · reddit · 2026-10-08
Reddit 用户分享自研的「穷人版 RCO」动态量化方法 v1:不发明新数学,而是用廉价近似复现 IST Austria RCO 的核心思想——在字节预算下按张量选精度,优化整模型任务 KL 散度。
流程:
- 先在全精度模型上生成 per-tensor 的 imatrix「敏感度曲线」,外推哪些张量最怕量化,得到初始量化配置基线。
- 再做迭代局部搜索:按文件大小上限替换各类张量精度,任何使 KL 散度升高的改动即被丢弃。
- 教师模型只需加载一次 dump token logprobs(可在 CPU 上做),之后仅需目标量化体积 +20-25% 缓冲的显存,全程几分钟到几小时。
Qwen 3.5 2B 早期结果:
- IQ3M + imatrix:999MB,平均 KLD 0.0984。
- RCO-lite +89MB(1088MB):KLD 0.0452,误差几乎减半。
- 上限 947MB(比 IQ3M 还小 52MB):KLD 0.0906,仍优于 IQ3M。
作者坦承预计打不过 GSQ-RCO 和 Unsloth Dynamic V3,但方法便宜、省显存、伪算法已文档化可复现。
「Infra」频道最新
- CoreWeave Fully Connected 大批产品齐发,SVP 首先向自家团队道歉 — thursdai_pod · 2026-10-08
- DuckDB 官方演示「零数据」数据库:几百 KB 管理整个数据湖 — RexDouglass · 2026-10-08
- Yudkowsky:预训练算力份额已降至 7%,能力尖峰预测重新生效 — repligate · 2026-10-08
- National Compute 上线数百台 MI355x 与 B300,免费补贴高校与政府 — ycombinator · 2026-10-08
- 微软 Windows 发布会秀本地模型,GitHub 推出 Auto 模型路由 — DanWahlin · 2026-10-08
- xAI 算法:Elon 以实验室估值募资投芯片,靠租数据中心赚钱 — PaulYacoubian · 2026-10-08