这个模型竟无 input/output 优化参数,仅 LM 头去 weight decay
stochasticchasm · x · 2026-09-11
stochasticchasm 在讨论某个模型架构(配有超大 engram 表)时注意到:作者原以为该模型完全没有 Adam 优化器参数,更正后确认仍保留少量 Adam 优化参数,但没有任何 input/output 优化参数这一点仍然非常酷。同一讨论串中另一条补充:语言模型头上也没有做 weight decay。
所属事件:Muon 成训练默认优化器,新模型砍 MTP、KV Cache 做 QAT(7 条相关)→
「模型」频道最新
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11
- 用户切回 GPT-5.6:省用量且体感更快 — CtrlAltDwayne · 2026-09-11
- 开发者观点:好的封装下模型差异很小,Grok 4.6 够用 — gnukeith · 2026-09-11