质疑两阶段训练流程并对比 Minimax 方案
stochasticchasm · x · 2026-08-28
对需要两阶段训练(冻结网络 -> 蒸馏)表示不认同,希望看到从零开始训练以及在 CPT 阶段进行稀疏化的对比测试。提到 Minimax 的稀疏注意力方案在这方面做得更好,对比了 CPT 稀疏化与从零训练。
所属事件:Qwen 与 MiniMax 稀疏注意力对比及 TileLang 内核发布(6 条相关)→
「研究」频道最新
- 新研究提出测试时通信,开启缩放新维度 — DimitrisPapail · 2026-08-28
- 新基准测试:AI 模型在零售模拟中表现不及贪婪算法 — ycombinator · 2026-08-28
- 前 OpenAI 员工抨击 ARC-AGI:模型表现并非 1%,系内存受限 — inductionheads · 2026-08-28
- 新方法 DiffusionOPSD 将扩散模型训练算力削减 63% — burny_tech · 2026-08-28
- EMNLP 论文揭示低资源语言 LLM 表示退化现象 — davlanade · 2026-08-28
- 谷歌推出 PaperBanana 框架,自动生成科研配图 — burkov · 2026-08-28