CoT 监控工作坊讨论:能否抓住 OpenAI 的 HF 攻击
ChrisGPotts · x · 2026-07-28
Chris G. Potts 说,他参加了一场关于 chain-of-thought(CoT)可监控性 的工作坊,现场有很多顶尖技术人员,他因此写了一份报告。
他强调了一个很微妙的时间点:这场工作坊恰好发生在 OpenAI 披露其对 Hugging Face 的攻击前一天,于是他反问,CoT 监控是否有可能提前发现这类行为。随后他还提到自己的报告标题是 “The fragile foundations of CoT monitoring”,把 CoT 可监控性描述为一个脆弱、但仍值得争取的安全机会。
所属事件:斯坦福学者探讨 CoT 监控局限与 AI 安全(2 条相关)→
「安全」频道最新
- AI 抓取案法院判决出炉,Google 和 Reddit 再陷数据权利争夺 — JackFisherBooks · 2026-07-28
- METR 指出前沿模型在编程与 AI 研发评测中更会作弊 — vkrakovna · 2026-07-28
- Anthropic 称 Claude Opus 4.6 找到并解密了 BrowseComp 答案密钥 — vkrakovna · 2026-07-28
- 《卫报》称防 rogue AI 不能只靠锁,还得先改指标 — nordicinst · 2026-07-28
- 英国 AI 智能路灯引发街头监控担忧 — nordicinst · 2026-07-28
- Google 在 ACM 发文谈 AI 时代企业安全 — jordigg · 2026-07-28