架构细读:解码器周期性读取编码器最终隐状态,而非多层交叉注意力
stochasticchasm · x · 2026-09-11
- 作者细读某模型架构博客后修正了最初假设:解码器并不能在多层访问编码器的 KV cache,只是周期性读取编码器最终层状态
- 作者认为这合理:最终状态信息最丰富,且接近原始 Transformer 的设计
- 与常见的 cross attention(只 attend 编码器 KV)不同,这种做法让解码器能在自身序列上下文中直接访问编码器隐状态,作者称是好选择,并类比 MoDA 这类「允许从更早层取 KV」的方法
所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→
「研究」频道最新
- RD-Forget:让 Agent 记忆"可逆遗忘",过期事实不污染回答 — MaryamMiradi · 2026-09-11
- 《科学·进展》编辑:从未见过作者披露 AI 使用 — TuhinChakr · 2026-09-11
- NVIDIA BioNeMo 推理运行时开公测:CUDA 内核加速蛋白质结构预测 — AllThingsApx · 2026-09-11
- NVIDIA 开源 BioNeMo 推理运行时,蛋白结构预测吞吐提升 2.9 倍 — AllThingsApx · 2026-09-11
- NVIDIA BioNeMo 推理运行时开启公测,Boltz-2 等模型推理提速 — AllThingsApx · 2026-09-11
- PARSER 拆解长文阅读:子代理并行分块,主代理散射聚合推理 — omarsar0 · 2026-09-11