FP4 KV cache 直出无退化,推理工程师有得玩了
stochasticchasm · x · 2026-09-11
作者评论某新模型架构的两个关键设计:一是 KV cache 直接以 FP4 精度存储且观察不到退化,二是通过 CSA(及其 v4 中 CSA/HCA 双频率交替的压缩方案,新设计改为纯 CSA2)压缩 KV。两者叠加使模型几乎不占 KV cache 空间。作者认为这对推理工程是大利好,同时好奇 kernel 缩减顺序等实现细节会对性能产生什么影响。
所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→
「Infra」频道最新
- 单张 RTX 3090 训 8 天:GPT-2 改造 MoE 从零训练成功 — rasbt · 2026-09-11
- B3IQ 两周卖出八位数 GPU,称 AI 基建是千亿美元机会 — templecrash · 2026-09-11
- 装个免费软件花掉 100 美元 API 费,agent 成本吐槽引共鸣 — MartinGTobias · 2026-09-11
- bartowski 为 GGUF 量化模型设计新张量布局,测试全面优于旧版 — noneabove1182 · 2026-09-11
- antirez 在 128GB M5 Max 上跑 DeepSeek v4.1 Flash,SSD 流式加载快得出乎意料 — antirez · 2026-09-11
- 分析称 OpenAI 仍有约 7 倍训练算力余量,开源差距只是暂未拉开 — soumitrashukla9 · 2026-09-11