「行为危险」不等于「AI 想杀我们」:工程视角看对齐

vishalmisra · x · 2026-09-16

Vishal Misra 在讨论中指出:AI 是否有意识无关紧要,被动系统同样可以危险;但「危险行为涌现」与「AI 内在想害人」是两回事。与其在模型里想象出一个有持续隐藏欲望的「小反派」,不如去检查训练、提示词、状态与循环这些可以实际修复的工程环节——权限与循环问题都是能落地解决的。

所属事件:斯坦福教授激辩对齐:隐藏恶意目标才是真正难题(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →