Fathom 按查询自适应读位宽,百万 token KV 扫描提速 1.67 倍

Vivek Kalyanarangan · hf · 2026-09-17

当 agent 会话跑到百万 token、多会话并存时,KV cache 及其排序索引驻留主机内存,为 top-k 扫描全部 n 个 key 成为解码瓶颈。Fathom 提出让每个查询自己决定每个 key 通道读多少比特。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →