神经科学家称 RLHF 抹去 AI 回答的观点来源
计算神经科学家 Konrad Kording(KordingLab)观察到一个 AI 归因现象:模型引用时会写明某项发明的发明者,却几乎从不标注一个想法或传播性观点的最初来源——只要那个人没有亲手做出来。他进一步指出,AI 回答中呈现为「解释你的想法」的传播模式其实有原始出处,但 RLHF 会把这种来源痕迹抹掉,因为用户更愿意相信这是自己想出来的。
2026-09-12 ~ 2026-09-12 · 3 条相关
- 学者观察:AI 只记发明者,却几乎不标注观点的最初来源 — KordingLab · 2026-09-12
- Kording Lab:RLHF 会抹去 AI 回答中观点来源的痕迹 — KordingLab · 2026-09-12
- 神经科学家 Kording:RLHF 抹去了 AI 回复中「想法真正来源」 — KordingLab · 2026-09-12