Nace AI 论文用 Hypernetwork 注入知识,不改 LLM 权重
rohanpaul_ai · x · 2026-07-25
Nace AI 发表了一篇新论文,提出一种在不改写基础模型核心参数的情况下,把大规模事实知识注入 LLM 的方法。
方法思路
- 基座模型保持冻结。
- 由一个 hypernetwork 根据事实语料生成一个固定的 LoRA adapter。
- 这个 adapter 插入目标模型后,模型就能回答与新知识相关的问题。
这项工作的意义
作者强调,这种做法把“存储新事实”和“修改基础模型”分离开来,使知识注入变成一种可复用流程,而不是每次都重新做一遍微调。
主要结果
- 论文研究了知识注入场景下 hypernetwork 架构的缩放规律。
- 还构建了名为 MegaWikiQA 的新数据集,包含跨 39 个知识领域 的数千万级多跳问答样本。
- 结果显示,该方法在规模增大时呈现可预测的扩展趋势,并且能泛化到未见过的实体和关系。
- 作者将其定位为比反复做 LoRA 微调或全量微调更可扩展的事实更新方案。
所属事件:NaceAI提出基于超网络的LLM知识注入法(2 条相关)→
「研究」频道最新
- ARC-AGI-3 测试发现 Claude Opus 5 展现代数推理新能力 — typewriters · 2026-07-25
- Cohere 举办 IOL-AI 2026,挑战大模型语言学推理极限 — Cohere_Labs · 2026-07-25
- Science 论文:首个人类扁桃体单细胞 3D 基因组图谱问世 — anshulkundaje · 2026-07-25
- Anthropic 公布 Claude 在 ExploitBench 上的安全评测结果 — TheZvi · 2026-07-25
- 循环 Transformer 学到的算法,先受训练预算而不是容量决定 — jm_alexia · 2026-07-25
- MIT 多智能体材料逆向设计项目获 Genesis Mission 奖项 — ProfBuehlerMIT · 2026-07-25