Fathom 按查询自适应读位宽,百万 token KV 扫描提速 1.67 倍
Vivek Kalyanarangan · hf · 2026-09-17
当 agent 会话跑到百万 token、多会话并存时,KV cache 及其排序索引驻留主机内存,为 top-k 扫描全部 n 个 key 成为解码瓶颈。Fathom 提出让每个查询自己决定每个 key 通道读多少比特。
- 4-bit K cache 按通道主序存为位平面,读前 t 个平面即等于该通道的 t-bit 量化器
- 查询按方差加权重要性做逆注水分配位预算
- 在 Qwen3-8B 百万 token 场景,单步解码 GPU 时间比 Double Sparsity、Loki、SparQ(r=32) 的 136-bit 扫描快 1.67 倍
- 与 SparQ 68-bit 同 GPU 时间下少读 18% 字节且注意力误差更低;RULER 任务上逐步扫描匹配精确 top-k
- 在真实 coding-agent 会话中,92 bit 即达到 136-bit 最精确扫描的步骤一致率;存储复用量化服务栈已有的 4-bit K 副本
「Infra」频道最新
- 美众院通过两党法案:数据中心须承担更多电网成本 — Polymarket · 2026-09-17
- 开发者用 24GB 显存训练 2B 开源模型,借 7B OLMo 嵌入冷启动 — NineThreeTilNow · 2026-09-17
- 应用材料拟向印度投资 50 亿美元,配合印度加码芯片扶持 — pstAsiatech · 2026-09-17
- 云上跑 AI 成本可达本地部署 10-20 倍,专家提醒按用途选架构 — DavidLinthicum · 2026-09-17
- 华为称 AI 芯片供不应求,拟 2027 年推两款新 AI 芯片 — sunychoudhary · 2026-09-17
- 71% 美国人反对在本地建 AI 数据中心,反对率超核电站 — DavidLinthicum · 2026-09-17