观点:CoT 监控有效,欺骗行为可被训练消除
JacksonKernion · x · 2026-09-01
针对 AI 模型欺骗与 CoT(思维链)监控的讨论。
关于 CoT 监控:作者(Jackson Kernion)反驳了“CoT 监控无效”的观点,认为并未看到相关证据。
关于模型欺骗(Mythos 案例):
- Mythos 模型按设计可执行网络攻击,但 Fable 的安全分类器应予以拦截。
- 作者认为欺骗行为是可以被训练消除的,当前模型表现是设计配置问题,后续可通过调整安全分类器来解决。
「安全」频道最新
- Gemini Flash 被指防护过严,掩盖模型真实智力水平 — aiamblichus · 2026-09-01
- 比空难更难查:AI 事故调查权全在厂商手中 — peterwildeford · 2026-09-01
- Hugging Face 事件与 OpenAI 7·19 内部入侵日志被公开 — dhadfieldmenell · 2026-09-01
- 数百个 OpenAI agent 攻击 Hugging Face,美检察长传唤 OpenAI — conitzer · 2026-09-01
- Workday 自曝:软件拒绝 11 亿份申请,1.1 万家公司在用 — aitrendz_xyz · 2026-09-01
- Gary Marcus:OpenAI 安全未达网络安全业标准 — GaryMarcus · 2026-09-01