KAIST 提出 Declarative Attention,让模型自选跳读 KV 缓存

kaist-ai · hf · 2026-09-03

KAIST AI 发布新方法 Declarative Attention:让语言模型在推理过程中自行声明相关上下文区域,从而跳过大部分 KV cache 读取,大幅减少实际需要关注的 token 数量,仅带来很小的准确率损失。这是让模型「控制自己的注意力」以降低推理成本的尝试。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →