新论文用推理时合并上千 LoRA 扩展局部 MoE
s_scardapane · x · 2026-07-29
通过模型合并做“几乎免费的”测试时训练
这篇论文提出 Test-Time Model Merging(TTMM):先在很多很小的数据簇上训练成千上万个 LoRA,再在推理时按需动态合并,把 MoE 扩展到比传统做法多得多的专家数量,同时几乎不增加测试时开销。
- 论文把 TTMM 解释为对 test-time training(TTT) 的近似:不是在每个任务上单独微调专家,而是把这部分成本前移到训练阶段完成。
- 作者声称,随着专家数量增加,TTMM 的表现会持续提升,并逐步逼近 TTT。
- 在 1B 参数基座模型上,TTMM 在测试时的速度据称比 TTT 快 100 倍以上,核心思路是把“临场训练”改造成“预先训练 + 运行时合并”。
- 配图同时对比了 TTMM、fine-tuning、ensembling 和 TTT,在测试时计算量与专家数量两个维度上展示差异。
「研究」频道最新
- 商汤开源 SenseNova-Vision,一模型覆盖检测到 3D 重建 — socialwithaayan · 2026-07-29
- 施密德胡贝尔称 AlphaFold 忽略了更早的蛋白结构预测工作 — SchmidhuberAI · 2026-07-29
- 新论文用逆强化学习从示范中提取可审计对齐奖励 — nagpalchirag · 2026-07-29
- AI 破译失传古语言:挑战线性 A 与伊特鲁里亚文 — Ars Technica AI · 2026-07-29
- Mozilla 和 IBM Research 聚焦评测驱动的 AI 保护栏 — LChoshen · 2026-07-29
- Anthropic Hawk 的 AES 密码分析线程获高度评价 — joshua_saxe · 2026-07-29