Jon Durbin设想:强制稀疏+掩码剪枝或让微调不再灾难遗忘
jon_durbin · x · 2026-10-07
Jon Durbin 探讨了「视差强制稀疏」(parallax enforced sparsity)可能带来的另一个数学魔法:既然该机制下约 50% 的权重被锁定在特定模式上,可以尝试掩码其余专家权重,只留稀疏连续权重去学习新数据。他的直觉是:这可能让基座模型对新领域/任务更具可塑性——SFT 或继续预训练时灾难性遗忘风险大幅降低,且不需要 RL、重采样等各种技巧。他强调这只是直觉,是否成立有待验证。
「模型」频道最新
- ChatGPT 传闻取消免费用户文字聊天上限并升级默认模型 — hey_abusiddik · 2026-10-07
- 5060 Ti 16GB 跑 Qwen3.8 Flash Next IQ1_M:55 tok/s 还能写出像样落地页 — bobaburger · 2026-10-07
- EmbeddingGemma 2 手机端离线跑多模态 RAG,文本仅占 191MB 内存 — Saboo_Shubham_ · 2026-10-07
- Paradigm 发布数学推理模型:7 项高难基准评测套件全开源 — tensorqt · 2026-10-07
- Limite 1B 借鉴 nanogpt speedrun 架构,用 NorMuon 训练 — tensorqt · 2026-10-07
- 1B 小模型 AIME 2026 考 94 分,Paradigma 开源 Limite 1B Violetto — tensorqt · 2026-10-07