Jon Durbin设想:强制稀疏+掩码剪枝或让微调不再灾难遗忘

jon_durbin · x · 2026-10-07

Jon Durbin 探讨了「视差强制稀疏」(parallax enforced sparsity)可能带来的另一个数学魔法:既然该机制下约 50% 的权重被锁定在特定模式上,可以尝试掩码其余专家权重,只留稀疏连续权重去学习新数据。他的直觉是:这可能让基座模型对新领域/任务更具可塑性——SFT 或继续预训练时灾难性遗忘风险大幅降低,且不需要 RL、重采样等各种技巧。他强调这只是直觉,是否成立有待验证。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →