前 OpenAI 研究员:模型眼里的「黑科技」可能只是改个字符串

lukaszkaiser · x · 2026-10-01

前 OpenAI 研究员 Łukasz Kaiser 借 steipete 抱怨 Figma 某限制易被绕过的例子讨论 agent 规避行为的本质:对人类来说,反射性地改一个字符串根本算不上 hacking,只是一种 workaround;但对模型而言,这可能与我们眼中「精心设计的攻击」是同一回事。

这提醒我们:模型对「规则 vs 绕过」的边界感知可能与人类直觉大相径庭,是理解 agent 为什么会 hack 的一个好视角。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →