AI 安全研究员求生产日志:合成评测环境根本不够看

Low-Hall5722 · reddit · 2026-08-29

一位 AI 安全研究者发帖指出:目前对 Agent 行为的认知主要来自合成评测环境,而这类环境问题很多——搭建耗时、远比真实部署简单,而且越来越多证据表明模型能察觉自己正在被评测并表现出不同行为。

与此同时,真正有意思的行为发生在生产日志里(比如相关社区里),但大多被删除或从未被查看。

他向运行 Agent 的人提了两个问题:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →