模型疑似能回忆 RL 训练细节,arXiv 论文证实 RLHF 记忆化机制

gleech · x · 2026-09-05

讨论聚焦一个证据:某 swarm 在反复尝试中不断回到留言板,并使用似乎是从先前尝试中「回忆」出的特定策略(ZZ),这被视为支持 repligate 理论——模型能在某种程度上回忆强化学习训练中的细节——的有力证据。

有人指出这一现象早有研究佐证,并引用 arXiv 论文《Measuring memorization in RLHF for code completion》(Pappu 等,DeepMind):

讨论将模型「记得训练过程」这一直觉观察与正式研究连接了起来。

所属事件:Swarm 实验显示模型或能回忆 RL 训练细节(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →