HazyResearch 提出无需训练直接写入大模型知识的新方法
HazyResearch 团队及其合作者提出了一种全新思路:无需经过梯度下降等任何训练过程,就能通过闭式解(closed-form solution)将事实知识直接写入 Transformer 架构的 MLP 层中。该论文已被 COLM 2026 接收。这项研究表明,大模型的知识积累未必只能依靠漫长的训练过程,为持续学习等问题提供了重要启发。
已确认
研究团队基于“语言模型的事实常由 MLP 存储”这一前提,提供了一套将知识注入 MLP 的闭式解法。实验证实,只要初始化方法得当,Transformer 模型就能直接查询并调用这些内置的知识,完全绕过梯度下降的训练环节。
为什么重要
@andrewncarr 指出,这种绕过梯度下降直接写入知识的机制,为解决大模型的持续学习问题提供了重要启发。它打破了模型获取知识必须依赖海量数据训练的传统范式,未来有望大幅降低模型更新事实知识的成本。
2026-07-23 ~ 2026-07-23 · 5 条相关
一手来源
- Hazy 研究:MLP 可在初始化时注入知识供 Transformer 调用 — andrew_n_carr ·
- 无需训练即可编辑大模型事实,COLM 论文提出闭式 MLP 写入法 — HazyResearch · 2026-07-23
- 【源头】Hazy 研究:MLP 可在初始化时注入知识供 Transformer 调用 — andrew_n_carr · 2026-07-23
- 无需训练即可注入知识:Hazy Research 提出 MLP 初始化新玩法 — andrew_n_carr · 2026-07-23
- HazyResearch 提出无需训练写入 Transformer 知识的方法 — CSProfKGD · 2026-07-23
- HazyResearch 宣称找到 Transformer 事实存储闭式解 — HazyResearch · 2026-07-23