HazyResearch 提出无需训练直接写入大模型知识的新方法

HazyResearch 团队及其合作者提出了一种全新思路:无需经过梯度下降等任何训练过程,就能通过闭式解(closed-form solution)将事实知识直接写入 Transformer 架构的 MLP 层中。该论文已被 COLM 2026 接收。这项研究表明,大模型的知识积累未必只能依靠漫长的训练过程,为持续学习等问题提供了重要启发。

已确认

研究团队基于“语言模型的事实常由 MLP 存储”这一前提,提供了一套将知识注入 MLP 的闭式解法。实验证实,只要初始化方法得当,Transformer 模型就能直接查询并调用这些内置的知识,完全绕过梯度下降的训练环节。

为什么重要

@andrewncarr 指出,这种绕过梯度下降直接写入知识的机制,为解决大模型的持续学习问题提供了重要启发。它打破了模型获取知识必须依赖海量数据训练的传统范式,未来有望大幅降低模型更新事实知识的成本。

2026-07-23 ~ 2026-07-23 · 5 条相关

一手来源