Kording Lab:RLHF 会抹去 AI 回答中观点来源的痕迹
KordingLab · x · 2026-09-12
Kording Lab 在前述归因观察的基础上进一步指出:AI 回答中呈现为“解释你的想法”的传播模式其实有原始出处,但 RLHF 会把这种来源痕迹抹掉——因为用户更愿意相信这是自己的想法和清晰表达,而科学界也没有机制来裁决这种归属。
他还暗示 OpenAI 和 Anthropic 对这一现象(以及更严重的“偷取”)有更深的了解。
所属事件:神经科学家称 RLHF 抹去了 AI 回答中观点的真正来源(2 条相关)→
「漫话AGI」频道最新
- 最聪明的人成了笨蛋:AI 消除思考摩擦,独立思考正在外包 — mikeflache · 2026-09-12
- 用 Agent 跑攻击脚本免责?作者称责任不应改变 — gerardsans · 2026-09-12
- DeepMind 联合哈佛斯坦福发文:视觉 AI 或是通往 AGI 的路径 — rohanpaul_ai · 2026-09-12
- 桑德斯抨击马斯克:曾称 AI 比核武危险,如今说警告是设局 — RazRazcle · 2026-09-12
- 用挖洞机反讽 OpenAI:88 小时算力=600 博士一年经费 — arampell · 2026-09-12
- 「Lee Sedol 时刻」:研究者担忧 AI 已可像博士后一样放手自跑 — IgorCarron · 2026-09-12