神经科学家称 RLHF 抹去 AI 回答的观点来源

计算神经科学家 Konrad Kording(KordingLab)观察到一个 AI 归因现象:模型引用时会写明某项发明的发明者,却几乎从不标注一个想法或传播性观点的最初来源——只要那个人没有亲手做出来。他进一步指出,AI 回答中呈现为「解释你的想法」的传播模式其实有原始出处,但 RLHF 会把这种来源痕迹抹掉,因为用户更愿意相信这是自己想出来的。

2026-09-12 ~ 2026-09-12 · 3 条相关