HazyResearch 提出无需训练即可写入 MLP 事实的新方法

HazyResearch 团队及其合作者提出了一种全新思路:无需经过梯度下降等任何训练过程,就能将事实知识直接写入 Transformer 架构的 MLP 层中。该研究指出,既然语言模型的事实常由 MLP 存储,就可以通过特定的初始化方法和闭式解(closed-form solution)直接“预装”这些知识。这项成果已被 COLM 2026 接收。

关键细节与潜在影响

研究团队不仅提供了将知识注入 MLP 的闭式解法,还证实了 Transformer 模型能够直接查询并调用这些内置的知识。@andrew_n_carr 指出,这种绕过梯度下降直接写入知识的机制,为解决大模型的持续学习问题提供了重要启发,表明知识积累未必只能依靠漫长的训练过程。

2026-07-23 ~ 2026-07-23 · 5 条相关