KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存
kaist-ai · hf · 2026-09-03
KAIST AI 发布新方法 Declarative Attention:让语言模型在推理过程中自行声明相关上下文区域,从而跳过大部分 KV cache 读取,大幅减少实际需要关注的 token 数量,仅带来很小的准确率损失。这是让模型「控制自己的注意力」以降低推理成本的尝试。
「Infra」频道最新
- RTX 5090 夜间自动生成股市简报,数字门禁杜绝 LLM 编造数据 — JakeChj · 2026-09-03
- 吴翼点评 Loop Transformer:真正的赢家是 Cerebras/Groq 式 SRAM 快推理 — bingxu_ · 2026-09-03
- Counterpoint:长鑫存储 Q2 DRAM 市占率达 10% — zephyr_z9 · 2026-09-03
- 开源 RL 框架 Miles 发布:面向企业级 LLM/VLM 后训练 — AravSrinivas · 2026-09-03
- 跑模型其实是跑内核:推理性能差距藏在 fused kernel 里 — EAccelerate_42 · 2026-09-03
- 全职妈妈拍家务日赚 120 元:机器人数据众包产业调查 — 创业邦 · 2026-09-03