QuixiCore 主张原生量化内核取代先反量化再执行
QuixiAI · x · 2026-07-27
QuixiCore 认为,推理路径不该先反量化再跑通用 kernel,而应该直接走原生量化计算。
- 配图里解释了当前方案的问题:Q80 → bf16 的反量化会带来额外内存流量和启动开销,还可能引入双重量化相关 bug。
- 他们提出改成原生的 Q80 absorbed-MLA BMM、原生 expert GEMM,以及按模型几何特征定制的 mladecode。
- 核心主张是:checkpoint 格式就应该是计算格式,这样能省掉反量化时间、避免 bf16 拷贝,也更利于排查回归问题。
- 这条帖子的重点不是概念宣传,而是一个可逐步落地、可验证的内核迁移方案。
「Infra」频道最新
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27
- 苹果智能眼镜、英伟达SK合作与携程51.79亿罚单汇总 — APPSO · 2026-07-27
- DeepSeek 融资传闻、欧盟 AI 透明度规则与 OpenAI 安全事故 — 创业邦 · 2026-07-27
- Nvidia 被曝洽谈为 OpenAI 俄亥俄数据中心提供 2500 亿美元背书 — Wonderful_Buffalo_32 · 2026-07-27
- Google JAXBench 给 TPU 内核优化补上 50 项实战基准 — omarsar0 · 2026-07-27
- 图表称 Anthropic ARR 已比 OpenAI 高出 328 亿美元 — wen_ragnarok · 2026-07-27