Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models
Nischay Dhankhar, Dos Baha, Abulhair Saparov
cs.CL, cs.LG
2026-07-22
这篇研究用超网络(一个副网络)读一批事实、生成一个固定 LoRA 适配器接到冻结的 LLM 上,首次给出超网络的缩放律:注入能力随宽度、深度、目标模型大小呈幂律,OOD 泛化比 LoRA 和全微调更陡,且优势随模型变大而扩大。
往大模型里可靠地、大规模地灌事实知识,一直是个没解干净的难题。全量微调又贵又容易灾难性遗忘,LoRA 这类 PEFT 降了成本但遗忘没根除,对没见过的实体和关系组合泛化也弱。更根本的是,通过 SFT 注入新事实本身就很慢,和预训练一致的事实学得快,新事实学得慢。这篇做的是训练时注入(train-time injection),不是推理时适配或知识编辑:超网络和所有基线都被训练成把固定事实语料压进目标模型权重,评测时不再访问那批事实。
用一个超网络,也就是第二个网络,读进一批要注入的事实,为冻结的目标模型生成一组 LoRA 式的权重改动。全程只学超网络的参数,目标模型的权重训练和推理时都冻结。超网络是基于 Transformer 的,随机初始化(不从预训练权重来),生成的 LoRA 用 rank 4、缩放因子 8,作用在目标模型最后约一半的层上。
设计上最关键的一步是把超网络的注入能力和目标模型的通用能力解耦:注入能力归超网络,通用能力归冻结的目标模型。这样第一次能严格、受控地研究超网络架构本身的缩放律,而不被目标模型的能力变化干扰。配套造了 MegaWikiQA 数据集,从 Wikidata5M(约 460 万实体、822 种关系、2200 万三元组)出发,每个跳数到 4 跳各有约 1000 万样本,最终分层抽出 125 万训练样本、39 个语义域,并显式留出哲学、语言学、土木工程做 OOD 划分。问题用确定性语法生成,不走神经生成。
两条主结论。
第一,注入质量沿所有架构轴呈幂律缩放。目标模型大小这条最陡:ID 验证 loss 指数 −0.226,OOD 非改写 −0.184。超网络宽度、深度也都给出可预测的幂律。
| 缩放轴 | OOD 改写 指数 |
| 超网络 | −0.107 |
| LoRA 微调 | −0.083 |
| 全量微调 | −0.069 |
| 缩放轴 | OOD MCQ 指数 |
| 超网络 | −0.171 |
| LoRA 微调 | −0.119 |
| 全量微调 | −0.101 |
第二,超网络的 OOD 缩放比 LoRA 和全量微调都陡,而且这个差距随目标模型变大单调扩大。也就是说,超网络的优势不是个固定偏移,模型越大越明显。
对关心知识注入、RAG 之外方案的团队,这篇把超网络从「测试时适配的小工具」抬成了「训练时注入的可缩放底座」,并给了第一组能指导设计的缩放律。OOD 泛化随规模变陡这件事尤其值钱:它意味着往更大的模型注入新事实,超网络相对微调的优势会越来越大,这正好是实际部署最关心的方向。
参数开销大:最高容量实验里超网络约 25 亿参数,而目标模型才 15 亿,超网络快赶上目标模型大了。规模只覆盖到 Qwen2.5-14B,70B 及以上的前沿规模是开放问题。评测只到单跳和浅层多跳,深层多跳组合推理能不能撑住没验证。所有轴里 OOD 改写(对语言表述变化的鲁棒性)缩放最平,说明这个问题靠单维度堆规模解决不了。作者来自 Nace AI,发布时也以「超网络知识注入规模律」对外宣传,结论偏正面,读的时候留意这个立场。