新论文:LLM 重现经典大鼠实验,会被正负引导偏好趋避

awjuliani · x · 2026-10-08

研究者将经典的大鼠行为实验搬到 LLM 上:在模型阅读关于两个无意义「区域」的内容时进行正向或负向引导。尽管两个区域的 token 完全相同,模型仍会主动寻找被正向引导的区域、回避被负向引导的区域;当给模型一个可操作的开关时,它还会主动关掉负向状态。作者在推文中附上完整线程展开细节。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →