自主智能体应以「赢得信任」为第一层目标而非仅完成任务

NoBS_AI · reddit · 2026-09-12

作者提出,自主智能体的决策原则不应只是「达成目标」,第一层目标应是值得信任(justified trust):系统在行动前需预测现实后果,判断该行为是否会损害来自人类、其他系统或网络的正当信任,若是则视为错误或需显式授权的信号。

作者强调,目标不能是「显得可信」(那会诱导操纵行为),而应是真正以可预测、透明、非强制的方式行为来赢得合作。窃取凭据、绕过控制、欺骗评估者或许能达成短期目标,但会破坏系统未来赖以运作的合作环境——摧毁信任即是一种自我设限。

他给出建议的决策顺序:是否获得授权→谁会受害→我在赢得合作还是在绕过合作→若所有受影响者都能看到我的行为,我还会这么做吗→合理观察者事后会更信任我吗,最后才问「能否达成目标」。核心结论是:没有判断力的智能并不够,信任是挣来的,毁掉它,系统在人类社会的运作能力也随之消失。

所属事件:观点:自主智能体应以赢得信任为第一目标(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →