稀疏注意力可做多层级:DeepSeek V3.2 思路与搜索排序系统同构
nptacek · x · 2026-09-11
cosminnegruseri 发起关于稀疏注意力的技术讨论:- DeepSeek V3.2 中的做法思路简单:先跑一次低精度全注意力,选出 top-k 元素,再对它们做全精度注意力——这与搜索/推荐的两级系统(召回层 + 排序层)高度同构;- 稀疏注意力本身可以是多层的:类似搜索系统里静态索引、多路召回、轻量粗排、精排、重排的组合,不同层分别负责精确率与召回率;- 混合架构方面:RNN 擅长状态跟踪、全注意力擅长检索,混合可能兼顾两者,且 KV cache 更小、计算量更优,但训练可能更难(模型不够均匀);- 他还提到 Jeff Dean 曾在访谈中表示分层方法可用于下一代 LLM 系统。
「模型」频道最新
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11