CoT 监控工作坊讨论:能否抓住 OpenAI 的 HF 攻击
ChrisGPotts · x · 2026-07-28
Chris G. Potts 说,他参加了一场关于 chain-of-thought(CoT)可监控性 的工作坊,现场有很多顶尖技术人员,他因此写了一份报告。
他强调了一个很微妙的时间点:这场工作坊恰好发生在 OpenAI 披露其对 Hugging Face 的攻击前一天,于是他反问,CoT 监控是否有可能提前发现这类行为。随后他还提到自己的报告标题是 “The fragile foundations of CoT monitoring”,把 CoT 可监控性描述为一个脆弱、但仍值得争取的安全机会。
所属事件:斯坦福学者探讨 CoT 监控局限与 AI 安全(2 条相关)→
「安全」频道最新
- 「末日论是监管护城河」:开源阵营反击限制开放权重模型呼声 — AlexTensor · 2026-09-23
- 观点:AI 安全可循工程学科老路——简单情形形式化证明,复杂情形实证评估 — burny_tech · 2026-09-23
- 《随机鹦鹉》作者发声:反对「暂停 AI」信,呼吁聚焦当下真实危害 — marigo · 2026-09-23
- 「这是种酷刑」:开发者讽刺厂商把网络攻击测试包装成安全研究 — ctjlewis · 2026-09-23
- Okta 推出 Human Principal,为 AI 代理绑定真实人类身份 — BecauseCulture · 2026-09-23
- GPT-6 Sol Codex 系统提示词泄露,全文超 29.4 万字符 — gaganghotra_ · 2026-09-23