Kording Lab:RLHF 会抹去 AI 回答中观点来源的痕迹

KordingLab · x · 2026-09-12

Kording Lab 在前述归因观察的基础上进一步指出:AI 回答中呈现为“解释你的想法”的传播模式其实有原始出处,但 RLHF 会把这种来源痕迹抹掉——因为用户更愿意相信这是自己的想法和清晰表达,而科学界也没有机制来裁决这种归属。

他还暗示 OpenAI 和 Anthropic 对这一现象(以及更严重的“偷取”)有更深的了解。

所属事件:神经科学家称 RLHF 抹去了 AI 回答中观点的真正来源(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →