Agent 轻信自记笔记,Mythos 现有护栏前寸步难行

voooooogel · x · 2026-09-11

作者 voooooogel 继续其 agent 实验串(agent 2 环节):指出自主 agent 会把「notes to self」里的内容直接当作事实采信,毫无质疑。

另一点观察:Mythos 在当前模型安全护栏面前表现挣扎,很难绕过。作者推测,如果未来出现需要政府证件等强验证的普遍性「人类证明」机制,这类 agent 基本会被彻底卡死——作者声明并非 endorsing 该方案,只是指出这一现实。

所属事件:对抗性验证码或成抵御 AI agent 的新防线(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →