学者洞察:推理模型爱“立靶子”或源于训练

sethlazar · x · 2026-08-07

哲学学者 Seth Lazar 观察到,当前的 AI 模型(尤其是推理模型)在生成文本时有一个明显的写作习惯:频繁地与一个“假想的愚蠢对手”进行辩论(例如使用“它不是...而是...”的句式)。

他推测,这种行为模式可能根源于推理模型的训练机制:那个“假想的愚蠢对手”实际上代表了基础模型倾向于直接预测下一个最可能 token 的原始冲动;而推理层模型为了抑制这种冲动,学会了先将其表述出来然后再加以驳斥。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →