长上下文的软max分母困境:注意力稀释与两条稀疏化出路
CShorten30 · x · 2026-10-02
Weaviate 播客片段(Siddharth)解释了长上下文窗口的一个数学问题,核心藏在 softmax 分母里:
- 注意力稀释机制:注意力的 softmax 分母要对上下文里的每个 token 求和,而相关 token 的分子大小不变,于是注意力得分被不断摊薄,直到正确文档几乎"淹没"在长上下文中。
- BlockSearch 的对策:采用长度感知的 softmax 缩放(length-aware scaling),并在注意力计算前就丢弃低分文档,直接缩小注意力需要处理的对象。
- REFRAG 的思路:解码器用预先计算好的 chunk embedding 替代大部分原始 token,再由一个轻量策略模型只对需要完整细节的 chunk 进行展开,两者都能大幅减少注意力负担。
该章节还讨论了稀疏注意力的现状以及向量数据库在这一方向上的结合机会。
「研究」频道最新
- Extropic 发布热力学递归智能首批成果,称算法效率提升百倍以上 — beffjezos · 2026-10-02
- ARC Prize 发现:Qwen3.8-27B 的 low/xhigh 档在 chat template 里写死不同指令 — GregKamradt · 2026-10-02
- 安全研究者重提 DataScalar:90 年代被埋没的近数据计算架构 — lauriewired · 2026-10-02
- AAAI 主席发帖:审稿改革意在劝退「微小结果」论文 — tdietterich · 2026-10-02
- 评测者自述防刷榜心法:全量轮换题目+随时换方法论 — airesearch12 · 2026-10-02
- GOLLuM 回顾基准成绩:找 Top-5% 结果命中率 36.3% 胜描述符 29.7% — pschwllr · 2026-10-02