超网络在 LLM 事实知识注入上呈现幂律缩放
Nischay Dhankhar · hf · 2026-07-23
这篇论文把 hypernetwork 当作一种在训练阶段向 LLM 注入事实知识的方法,研究它在大规模场景下的缩放规律。
作者的做法是:先用包含大量事实的语料训练 hypernetwork,再让它生成一个固定的 LoRA adapter,插入目标模型后,模型就能回答与这些事实相关的问题。论文还构建了一个名为 MegaWikiQA 的大规模数据集,基于 Wikidata5M 生成了覆盖 39 个领域、数千万级多跳问答样本,并系统考察 hypernetwork 的深度、宽度和目标网络规模如何影响效果。
主要结论包括:
- hypernetwork-based injection 在各个架构维度上都呈现出可预测的 幂律缩放;
- 随着规模增大,它具备更可靠的 OOD 泛化;
- 在 OOD 评测上,它的缩放指数优于 LoRA 微调和全量微调。
作者据此认为,hypernetwork 可能是一种更有原则、也更可扩展的训练时适配底座。
所属事件:NaceAI 提出超网络知识注入法,无需修改大模型权重(4 条相关)→
「研究」频道最新
- 3D ResNet 论文八年突破 3000 引用,Kinetics 数据集成里程碑 — HirokatuKataoka · 2026-09-11
- 把数据调度变成优化的一部分:样本选择与排序影响 LLM 训练 — Puzzleheaded_Box2842 · 2026-09-11
- Jeff Heaton《神经网络数学导论》开放免费完整下载 — blaizedsouza · 2026-09-11
- 数学家 Daniel Litt 上线问题库,15 题仅 1 题被解,用来追踪 AI 解题进度 — littmath · 2026-09-11
- AI 智能体协作优化 secp256k1 量子电路,挑战打破 ECDSA — StefanoGogioso · 2026-09-11
- Alex Townsend 汇编 200 个数值线性代数开放问题,供人类与 AI 攻关 — IgorCarron · 2026-09-11