Internalizer 超网络为 284B 大模型一键生成文档级 LoRA 适配器
teortaxesTex · x · 2026-10-11
arXiv 论文 Internalizer 提出可移植的 Context-to-Parameter Mapping 超网络,把上下文直接写进模型权重:
- 此前类似 hypernetwork 只在 14B 以下模型上验证过,此工作首次针对 284B 参数的 DeepSeek v4 Flash(比以往大两个数量级)
- 超网络大部分参数在模型无关的 trunk 中,仅出入口层与基座模型绑定,因此可先在小模型上便宜训练再移植到大模型
- 在最长 4096 token 的未见文档上,生成的适配器达到 84.9% top-1 / 97.8% top-5 teacher-forced 准确率,基座模型仅 63.4% / 83.5%,且上下文窗口里只需三个词的指令
- 训练好后一次前向传播即可把任意文档变成适配器,可单独服务提速,或与原文档同窗口使用进一步提升准确率
「研究」频道最新
- 单次前向输出决策结果:用 Qwen3-1.7B 复刻 Jev 决策模型 — bibryam · 2026-10-11
- MIT 韩松 2026 秋季《高效 AI 计算》课程开讲,含剪枝量化与 LLM 部署 — HildeKuehne · 2026-10-11
- 三本免费 ML 系统好书:哈佛《Intro to ML Systems》与 LLM 基础教材 — caglar_ee · 2026-10-11
- Claude 30分钟复现天文学家400小时成果,还从旧数据挖出隐藏行星系统 — scottleibrand · 2026-10-11
- Berkeley 演讲:推理有结构,置信度可控可省 25% 思考 token — datawithsuman · 2026-10-11
- 论文:LLM 在医学诊断中太「顺从」,谄媚导致诊断不稳定 — lulzxdxdxd · 2026-10-11