Boltzbit 与剑桥团队用超网络把上下文动态编译进权重,告别重复读 Prompt
xiaohu · x · 2026-09-21
现在的 LLM 训练完权重即冻结,用户对话中的新事实、纠错和长文档只能塞进上下文窗口,每轮从头重读,烧显存且聊完即忘。Boltzbit 与剑桥大学团队提出"无限参数"方案:用轻量超网络(Hypernetwork)把实时交互数据动态编译成低秩 LoRA 权重,相当于"临时写进脑子里";再用贝叶斯机制让这套权重随对话上下文滚雪球式演化。
与传统 MoE 的区别:传统 MoE 在固定的 64/128 个专家里做离散路由,解空间是有限凸包;该方案不存固定专家,而是在连续隐空间里按需生成专属专家,权重数量无边界。
三组核心实验结论:
- 短文本场景拼不过直接读 Prompt;
- 长文档、多干扰项、多轮对话中全面反超传统方案;
- 多轮对话中,对指代不清的代词(如"它的作者?")理解准确率随轮数单调上升,接近满分;
- 每轮只做固定维度内积更新,第 1 轮到第 100 轮算力成本恒定。
「研究」频道最新
- 论文不再是科学的基本单元:用可验证研究工件构建知识图谱 — valis2400 · 2026-09-21
- 蛋白质设计工具 BindCraft2 发布,代码即刻开源免费商用 — mmbronstein · 2026-09-21
- Komlós 猜想再添更简证明,Karingula 与 Lovett 新版 arXiv 上线 — stevenstrogatz · 2026-09-21
- Komlós 猜想被宣布解决,数学家点出其对神经网络量化的隐含意义 — stevenstrogatz · 2026-09-21
- CIC+LEM 竟可证明 Con(ZF),Mario Carneiro 用 AI 工具获突破 — leloykun · 2026-09-21
- Qwen 团队发布 OmniVChat:原生音视频对话的数据引擎与基准 — Qwen · 2026-09-21