「持续学习」需要更好的分类学:五种机制的拆解

Typical-Scene-5794 · reddit · 2026-09-03

作者指出「continual learning」常被当作机制名词使用,实际是一个问题设定:部署后持续获取知识/技能而无需全量重训。不同人说的可能是完全不同的东西,他提出五分法:

1. 长上下文 ICL:权重冻结,靠上下文中的示例、反馈和历史完成任务。局限:工作记忆巨大,但无法从当前上下文迁移到长期记忆。

2. 可变文本层优化:重写冻结模型周围的文本层——系统提示、skill 文件、playbook、记忆库、检索索引、harness 代码。关键权衡:遗忘并未消失,只是从权重干扰转移到记忆构建与检索,新旧经验仍在有限上下文里竞争。

3. 冻结权重的循环/架构级潜在记忆:任务信息写入不断演化的内部状态(非 KV cache 增长或文本文件),如 BDH-CQ 等多时间尺度自修改架构,模型仅通过状态更新在推理时适应。

4. 每任务测试时训练:把演示变成小训练集做梯度更新、生成答案后可能丢弃更新。ARC 管线(如 HRM/TRM)属于此类;作者认为若无跨任务持久化,算不算「持续」存疑。

5. 在线参数化持续微调:部署后持续施加梯度。难点是测试时找到好的标签/奖励,以及不破坏既有能力(replay、正则化、参数隔离、稀疏定向更新)。混合式系统用文本自产微调数据但写入权重。代价:灾难性遗忘,且累积的权重更新可能撑不过底座模型升级。

作者邀请读者讨论分歧与遗漏。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →