Bartowski 发文解析 GGUF 量化新方案:按张量布局映射分配位宽
bartowski1182 · x · 2026-09-11
知名量化维护者 Bartowski 在 Hugging Face 发表博客,提出 llama.cpp GGUF 量化中的新「per-tensor layout maps」(按张量布局映射)方法。
- 背景:随着 MoE 模型流行,上游 llama-quant.cpp 算法对超过 8 个专家的模型处理不佳;shexp 张量虽小但对精度敏感。Bartowski 此前维护自己的分支来更好地处理 MoE,但随新模型涌现需要新方案。
- 问题:上游代码与其改动都是 model-agnostic 的,只按张量形状和位置做「动态」位宽分配(如前 1/8、后 1/8 层和每三层中给更高量化值、对注意力层区别处理),上限明显。
- 新思路:为新布局方法设计按张量粒度的映射,让量化位宽分配更贴合具体模型结构。研究部分由 Framework 桌面完成。
所属事件:bartowski 为 GGUF 量化模型设计新张量布局,测试全面占优(2 条相关)→
「Infra」频道最新
- DeepSeek-V4.1-Flash 上线 Fireworks:552B MoE 主打编码与智能体 — lqiao · 2026-09-11
- OpenAI Agents API 接入 Cloudflare,4 分钟部署带 D1 日志的智能体 — craigsdennis · 2026-09-11
- 单张 RTX 3090 训 8 天:GPT-2 改造 MoE 从零训练成功 — rasbt · 2026-09-11
- B3IQ 两周卖出八位数 GPU,称 AI 基建是千亿美元机会 — templecrash · 2026-09-11
- 装个免费软件花掉 100 美元 API 费,agent 成本吐槽引共鸣 — MartinGTobias · 2026-09-11
- bartowski 为 GGUF 量化模型设计新张量布局,测试全面优于旧版 — noneabove1182 · 2026-09-11