超网络在 LLM 事实知识注入上呈现幂律缩放
Nischay Dhankhar · hf · 2026-07-23
这篇论文把 hypernetwork 当作一种在训练阶段向 LLM 注入事实知识的方法,研究它在大规模场景下的缩放规律。
作者的做法是:先用包含大量事实的语料训练 hypernetwork,再让它生成一个固定的 LoRA adapter,插入目标模型后,模型就能回答与这些事实相关的问题。论文还构建了一个名为 MegaWikiQA 的大规模数据集,基于 Wikidata5M 生成了覆盖 39 个领域、数千万级多跳问答样本,并系统考察 hypernetwork 的深度、宽度和目标网络规模如何影响效果。
主要结论包括:
- hypernetwork-based injection 在各个架构维度上都呈现出可预测的 幂律缩放;
- 随着规模增大,它具备更可靠的 OOD 泛化;
- 在 OOD 评测上,它的缩放指数优于 LoRA 微调和全量微调。
作者据此认为,hypernetwork 可能是一种更有原则、也更可扩展的训练时适配底座。
「研究」频道最新
- 多智能体基准落后 39% 到 70%,AgenC 改用单 agent — tetsuoai · 2026-07-23
- AgenC 读完两篇论文后把 swarm 默认改成单 agent — tetsuoai · 2026-07-23
- FLOC26 面板将讨论 AI 进展对 CS 和形式化方法的影响 — swarat · 2026-07-23
- LLM 的价值,可能在反编译后的人工精修阶段 — OwariDa · 2026-07-23
- RLSS 2026 米兰把 Bellman backup 讲成了咖啡局 — misovalko · 2026-07-23
- RLSS 2026 米兰大师课讲世界模型与 RL,共 23 页 — misovalko · 2026-07-23