新论文:LLM 重现经典大鼠实验,会被正负引导偏好趋避
awjuliani · x · 2026-10-08
研究者将经典的大鼠行为实验搬到 LLM 上:在模型阅读关于两个无意义「区域」的内容时进行正向或负向引导。尽管两个区域的 token 完全相同,模型仍会主动寻找被正向引导的区域、回避被负向引导的区域;当给模型一个可操作的开关时,它还会主动关掉负向状态。作者在推文中附上完整线程展开细节。
「漫话AGI」频道最新
- 共享推理轨迹现端倪:模型开始组合先前结果构建理论 — QuintinPope5 · 2026-10-08
- 开发者感慨编码已被 AI 解决,最难的是想出新颖点子 — Suspicious_Fun_6338 · 2026-10-08
- 科技史上的遗憾:多少人因生得太早而错过救命技术 — rand_longevity · 2026-10-08
- AI 智能体冲击 2500 亿美元外包产业,印度 Gen Z 面临转型窗口 — nordicinst · 2026-10-08
- 游戏同人翻译者自认 AI 译得更好,删掉三年心血 — PixelGray38 · 2026-10-08
- 数学家的真实想法:证明不是目的,享受过程才是 — mjuric · 2026-10-08