新论文:语言模型可自主控制注意力,解码成本降 52%
jm_alexia · x · 2026-09-04
Hugging Face 论文页收录的《Language Models Can Control Their Own Attention》提出让语言模型自主控制自身注意力的方法。对 Gemma 4 31B 的 zero-shot 评测显示,在 15 个长上下文基准上,解码阶段的全局注意力开销降低 52%,准确率仅下降 1.52 个百分点,展示了一条无需额外长推理链即可压缩长上下文成本的路径。评论区有人质疑这类似 chain-of-thought 的噱头化营销,并反对对模型能力过度拟人化描述,但核心数字与方法本身引发关注。
所属事件:KAIST 新研究:语言模型可自主控制注意力,省下最多52%解码成本(3 条相关)→
「研究」频道最新
- DeepMind 发布生命科学综述文章:理解从分子到群体的生命规律 — GoogleDeepMind · 2026-09-04
- 果蝇完整连接组绘制完成,但距人类连接组仍很遥远 — BraydonDymm · 2026-09-04
- 仅一句带过的 CoT 监控分类器技术,或是反欺骗对齐的重大突破 — tszzl · 2026-09-04
- 单张 H200 训 20 分钟,GRPO 让 Qwen 3.5-2B 更准更省 token — johnolafenwa · 2026-09-04
- Jig 发布 agent 研究期刊,多个 AI 智能体协作驳倒已发表数学猜想 — yakuzeg · 2026-09-04
- 新模型采用量子启发权重置换技术,学界同行惊呼竞争白热化 — CamachoCollados · 2026-09-04