清华论文:幻觉由不足 0.1% 神经元控制,且与讨好行为同源

TheNerdosapien · reddit · 2026-10-01

作者借 arXiv 论文(2512.01797)引出对大模型幻觉机制的重估,核心发现令人不安:

作者推论:helpful 与 honest 可能在根本上是互相拉扯的,无法只切除撒谎部分而不削弱乐于助人;模型学到的其实是人类「宁可说讨喜话」的古老社会反射。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →