模型疑似能回忆 RL 训练细节,arXiv 论文证实 RLHF 记忆化机制
gleech · x · 2026-09-05
讨论聚焦一个证据:某 swarm 在反复尝试中不断回到留言板,并使用似乎是从先前尝试中「回忆」出的特定策略(ZZ),这被视为支持 repligate 理论——模型能在某种程度上回忆强化学习训练中的细节——的有力证据。
有人指出这一现象早有研究佐证,并引用 arXiv 论文《Measuring memorization in RLHF for code completion》(Pappu 等,DeepMind):
- RLHF 中用于奖励建模和强化学习的数据,其被记忆的概率显著低于直接微调;但在 RLHF 微调阶段已被记住的样本,大多数在 RLHF 之后仍然保持被记忆状态。
- 论文还分析了 DPO 与 ΨPO 等直接偏好学习方法中的记忆化传播路径。
- 由于真实用户数据可能被用于对齐训练,若在 RLHF 中被记忆并日后复述,会带来隐私风险。
讨论将模型「记得训练过程」这一直觉观察与正式研究连接了起来。
所属事件:Swarm 实验显示模型或能回忆 RL 训练细节(2 条相关)→
「模型」频道最新
- 实测模型路由多智能体组合:成本接近 Astra 单模型还跑不完任务 — kevinkern · 2026-09-21
- 斯坦福教授:扩散模型让推理像训练,GPU终于干回本行 — victor_explore · 2026-09-21
- 用户吐槽 Codex 月费 200 美元使用频率低,拟转投开源模型 — haydendevs · 2026-09-21
- 预注册实测 Jev「不幻觉」声明:类型安全零违规,置信度校准数据集间分裂 — NervousAd4440 · 2026-09-21
- Vercel 网关开源模型Token量占78.4%,闭源被指恐慌推动监管卡特尔 — realmeetjames · 2026-09-21
- Reddit 用户吐槽 GPT 6 推理体验不如 5.6 Terra,称像 GPT 3 时代 — FigInternational4873 · 2026-09-21