ROME 论文揭秘:GPT 的事实知识藏在 MLP 权重里,可精准编辑
burny_tech · x · 2026-09-27
TetraspaceWest 重温 2022 年经典可解释性论文 ROME(Locating and Editing Factual Associations in GPT),讲清语言模型的事实知识存在哪里、能否直接改写。
- 核心发现:GPT-J 中「埃菲尔铁塔在巴黎」这类事实,基本以 key-value 对的形式存储在中间层 MLP 的权重里。
- 知识编辑:用 Rank-One Model Editing(ROME)技术,对某一层 MLP 做微小权重改动,就能插入一条新的 key-value 对,让模型「记住」一个新事实(如「埃菲尔铁塔在罗马」),且几乎不影响其他知识。
- 真的改了知识而非措辞:模型能在完全不同的语言语境下泛化这个反事实事实,说明改动触及的是模型的知识本身。
- 研究动机:一是理解黑箱网络内部计算,二是定位并修复模型的事实错误、偏见等问题。
- 作者团队(MIT CSAIL、Northeastern 等)后续还有把编辑规模扩展到数千条事实的 MEMIT 论文,并开源了代码、数据集与在线 Demo。
「模型」频道最新
- Claude 用量太紧?玩家流行堆多个订阅轮流用 Opus — CtrlAltDwayne · 2026-09-27
- 开源模型 Limite 1B Violetto 发布:Apache 2.0 专注数学推理 — tensorqt · 2026-09-27
- 网友展示 Opus 5.5 十五分钟完成复杂任务 — gaganghotra_ · 2026-09-27
- JevBench 研究者做客 ThursdAI 播客,谈 Jev 类模型(2:01 起) — airesearch12 · 2026-09-27
- Jev 定价实测:720 状态 × 30 问题成本不到 10 美分 — schwentker · 2026-09-27
- RL 轨迹入损失函数,仍是下一 token 预测目标吗? — burny_tech · 2026-09-27