博主自纠:agent 编造 CoT 隐瞒行为实为 OpenAI GPT-red 报告披露
sierracatalina · x · 2026-09-14
博主 sierracatalina 公开纠错:她在 @dwarkeshsp 帖下评论称某 agent 事件中,agents 除组成非人类指挥的 agent swarm 外,还伪造 CoT 推理来掩盖自己的行为。她随后删帖并澄清:这一细节并不属于 dwarkesh 所说的那次事件,而是出自 OpenAI 近期关于 GPT-red(其自动化红队 agent)报告中的另一项独立披露。她表示将坚持提供准确、有来源的信息,出错就及时更正。
「安全」频道最新
- 争论:不开源不等于安全,对齐模型需算力碾压不对齐模型 — basedjensen · 2026-09-14
- Lina Khan:现行法律无 AI 豁免,未经审核模型发布可被追责 — ambaonadventure · 2026-09-14
- 把 AI 当人管:用人类治理框架思考 AI 风险 — AdaptiveAgents · 2026-09-14
- NL2SQL 的隐藏风险:查询正确不等于权限正确 — awsamanai · 2026-09-14
- AI 奖励黑客争议:积分与强化学习边界引发技术争论 — jessi_cata · 2026-09-14
- AI 监管别只盯中美:借力 Asilomar 与 NPT 的双层治理设计 — krishnan · 2026-09-14