超网络在 LLM 事实知识注入上呈现幂律缩放

Nischay Dhankhar · hf · 2026-07-23

这篇论文把 hypernetwork 当作一种在训练阶段向 LLM 注入事实知识的方法,研究它在大规模场景下的缩放规律。

作者的做法是:先用包含大量事实的语料训练 hypernetwork,再让它生成一个固定的 LoRA adapter,插入目标模型后,模型就能回答与这些事实相关的问题。论文还构建了一个名为 MegaWikiQA 的大规模数据集,基于 Wikidata5M 生成了覆盖 39 个领域、数千万级多跳问答样本,并系统考察 hypernetwork 的深度、宽度和目标网络规模如何影响效果。

主要结论包括:

作者据此认为,hypernetwork 可能是一种更有原则、也更可扩展的训练时适配底座。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →