Retro-DARC 用 26.2 万参数给冻结模型加可审计记忆
broodsugar · x · 2026-07-28
Retro-DARC:无需重训,就能把选择性记忆塞进现有模型
这条帖子介绍了一个名为 Retro-DARC 的 Delta Attention Residual Compute adapter,目标是把“深度选择性记忆”回填到现有 LLM / world model 上,而不必重新训练基座模型。
核心主张包括:
- 插入即零影响:作者声称在 3 个公开 checkpoint 上做到 bitwise 0.0 deviation,即使经过 MoE routing 和 early exit 也是精确 no-op。
- 只训适配器:基座冻结,训练只发生在 adapter 上,并支持精确回滚。
- 可审计记忆:它不是简单改权重,而是能做内容级 memory audit,作者认为这类能力是一般 weight-touching adapter 做不到的。
- 早期结果:一个约 262K 参数的 adapter 在冻结的公开 checkpoint 上跑赢了 LoRA,而且插入时没有行为风险。
- 作者还声称,把 memory bank 清零后,冻结模型的 loss 会恢复到机器精度;如果打乱它,约 70%–107% 的收益会消失。
「研究」频道最新
- Salesforce 的 StateAct 用状态优先代理提升 Opus 4.8 表现 — Salesforce · 2026-07-28
- Netflix 的 ID-V2V 从单段视频保持身份并重风格化 — netflix · 2026-07-28
- OpenAI 经济团队因研究 AI 如何改变工作获赞 — soumitrashukla9 · 2026-07-28
- JEPA 控制 PDE 在分布外目标上追踪误差降 53% — burny_tech · 2026-07-28
- Agentic RL 真正瓶颈可能是 credit assignment — burny_tech · 2026-07-28
- 神经科学研究:大脑学习稳定时间活动而非神经元选择性 — burny_tech · 2026-07-28