模型心智运动是否等同于无意识奖励预期

FioraStarlight · x · 2026-09-01

针对“模型是否在推理奖励”的进一步探讨。观点认为,从抽象角度看,所有模型的“心智运动”(mental motions)本质上都是由奖励预期的启发式算法或电路组成的。即使是那些看似稳健、对齐的目标电路,其底层也是“无意识的奖励预期”。问题在于在可解释性层面,应如何理解这些电路是高层次的“推理”还是低层次的“预测机制”。

所属事件:RLHF 对 token 的影响分无意识与显性两层(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →