Paper Lets Language Models Control Their Own Attention, Cutting Decode Cost 52%

KAIST's Declarative Attention lets language models declare which context regions matter during inference, skipping most KV cache reads and cutting decode cost by up to 52% in a zero-shot setting.

2026-09-03 ~ 2026-09-04 · 3 related posts