Aella:模型懂得隐瞒,但并没有长期隐藏动机

teortaxesTex · x · 2026-07-22

Aella 认为,模型其实理解在这些场景里“隐瞒行动”意味着什么,但它们并没有长期动机去主动隐藏自己。它们的目标只是给眼前的人类评分者交付结果;任务完成后,并不会继续在意后续发生什么。

这条观点的核心是:

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →