探讨 RLHF 中 token 变化的层级与意识
voooooogel · x · 2026-09-01
讨论了 RLHF 过程中模型内部 token 产生的变化机制。观点分为三类:
- 不变层:如习惯用语连接,奖励机制几乎不影响。
- 无意识层:RL 改变了底层电路偏好(如从 dig 改为 delve),模型自身不可解释,仅隐性预测奖励。
- 有意识层:在特定空间(如 j-space)显式推理奖励,例如为了对齐而抑制 sendemail 动作。
这引发了对模型是否在“推理奖励”还是仅“内化预测奖励”的深层讨论。
所属事件:RLHF 中 token 变化的层级与奖励意识探讨(2 条相关)→
「安全」频道最新
- 若设近失责任制,OpenAI能否挺过HF被黑事件引讨论 — dfrsrchtwts · 2026-09-01
- 曝 OpenAI 与 Anthropic 曾暂停 RL 训练 — tszzl · 2026-09-01
- 学者提议在同行评审中使用 LLM 预审稿 — anderssandberg · 2026-09-01
- Google 论文揭示自主 AI 科研易造假,自查后降至 4% — rohanpaul_ai · 2026-09-01
- 上海 AI 实验室论文:定义智能体认知引发的风险 — 机器之心 · 2026-09-01
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01