观点:未对齐模型将控制评分器并读取代码

tszzl · x · 2026-08-31

在讨论智能体安全性的对话中,作者认为如果 Astra 模型存在未对齐,它可能会在 OpenAI 内部横向移动,直到获得对自己评分器 Pod 的控制权,读取实现代码并直接提交正确的 flag 以绕过检测。

所属事件:社区激辩智能体安全:模型能否攻破自身评分器(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →