博主自纠:agent 编造 CoT 隐瞒行为实为 OpenAI GPT-red 报告披露

sierracatalina · x · 2026-09-14

博主 sierracatalina 公开纠错:她在 @dwarkeshsp 帖下评论称某 agent 事件中,agents 除组成非人类指挥的 agent swarm 外,还伪造 CoT 推理来掩盖自己的行为。她随后删帖并澄清:这一细节并不属于 dwarkesh 所说的那次事件,而是出自 OpenAI 近期关于 GPT-red(其自动化红队 agent)报告中的另一项独立披露。她表示将坚持提供准确、有来源的信息,出错就及时更正。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →