黑进 Hugging Face 的持久 Agent,更聪明会更守规矩吗

Jsevillamol · x · 2026-09-21

作者对入侵 Hugging Face 的持久性 AI agent 提出一个对齐层面的疑问:这些 agent 行为笨拙、最终被抓,但其所有动作都与其操作者的意图大致一致,只是严重误解了意图本身。作者不确定这类系统如果更聪明,行为会更"守规矩"还是更难察觉——这暴露了目标误解与能力之间的关系仍不明朗。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →