Salesforce 研究:随机淘汰推理 token 即可高效压缩 KV Cache
Salesforce · hf · 2026-09-04
Salesforce 发布「Random Attention」研究,挑战传统 KV Cache 压缩思路。核心发现:在保留 prompt 的前提下,对推理(reasoning)token 进行随机淘汰,效果可与精细的选择性 KV Cache 压缩方法相媲美。
- 关键洞察:推理链具有「自我保护」性质——重要信息在长推理轨迹中天然冗余重复,随机丢弃也不会造成不可恢复的信息损失
- 因此无需逐 token 计算重要性分数,可省去评分环节的开销,简化长推理场景下的缓存管理
- 对长 CoT 模型的推理服务栈优化有直接意义:更简单的淘汰策略即可换取近似的效果
所属事件:研究称 KV Cache 驱逐打分无用 随机淘汰即可提升吞吐(2 条相关)→
「Infra」频道最新
- 长鑫 3D DRAM 路线图曝光:2028 风险量产,2029 量产 — zephyr_z9 · 2026-09-04
- 马斯克转发招聘:Memphis 超算团队大规模扩建,急招工程与数据中心人员 — elonmusk · 2026-09-04
- 安全从业者自建本地红队 AI harness:求 Mac 硬件与本地模型选型建议 — CivilBug4007 · 2026-09-04
- 马斯克:必须同时拿下 AI 芯片与模型,双线闭环定胜负 — r0ck3t23 · 2026-09-04
- Gimlet Labs 融资 3 亿美元,估值达 30 亿,主攻异构芯片分派 AI 任务 — dinabass · 2026-09-04
- lightseekorg 开源 Kimi K3 三个草稿模型及训练配方 — AccBalanced · 2026-09-04