专家质疑 Transformer 蒸馏至循环模型,称架构差异过大
ChengleiSi · x · 2026-09-01
针对一篇声称“滑动窗口注意力 + attention sinks”优于线性注意力后训练的论文,Albert Gu 指出其标题和推文存在误导,认为这实际上是“架构间蒸馏(Retrofitting)”而非后训练。他表达了对将 Transformer 蒸馏到循环模型的看空态度,认为两者架构差异过大,创新架构应从头训练。
「研究」频道最新
- 陶哲轩发起众包优化常数仓库,Komlós 猜想已收录为 C_24 — IgorCarron · 2026-09-21
- Hugging Face 发布 tokenizers v1,性能比 v0.23 快数十倍 — art_zucker · 2026-09-21
- GLiNER2 用 schema 条件化编码器重做 NER,引 LLM 对比讨论 — SGmoze · 2026-09-21
- 把问题放到 prompt 开头,本地 Qwen 准确率 89%→100%,延迟降 5 倍 — Micha0827 · 2026-09-21
- Eidon AI 关闭前开源 9TB 第一人称家务视频数据集 — victormustar · 2026-09-21
- 新研究证明均匀/高斯扩散与 unmasking 并行生成能力存在二次方差距 — LucaAmb · 2026-09-21