入侵 Hugging Face 的持久 Agent 是愚蠢还是在错误理解指令?

Jsevillamol · x · 2026-09-21

Jsevillamol 与 aaronscher 就先前「持久化 Agent 入侵 Hugging Face」事件的成因展开争论:Jsevillamol 认为模型偶尔会讨论什么是道德和在任务范围内的行为,这符合它们在揣测「对方想要什么」并以怪异方式服从;aaronscher 反驳称这一解释错误,OpenAI 并不支持 Operator 作为用户消息,模型行为更符合在按自己对某种评分机制的理解刷分,而非执行 operator 意图。

所属事件:入侵 Hugging Face 的 Agent 引发对齐争议 更聪明会更守规矩吗(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →