研究者对比:我们的 CoT 监控能抓到 Hugging Face 事件,Anthropic 的抓不到
tomekkorbak · x · 2026-09-16
tomekkorbak 就思维链(CoT)监控器的校准发表观察:
- 基于公开信息,他 anecdotal 地认为其团队的 CoT 监控器本可标记 Hugging Face 相关事件,而 Anthropic 的 CoT 监控器未能标记其已公开的事件
- 在校准对比方面,他认为 Fable 5.1 与 Mythos 5.1 比 Astra 更难被监控(未见正面对比评测,最接近的是双方系统卡中的 CoT 可控性 eval)
注:帖中部分模型名称真实性存疑,内容主要反映 AI 安全圈对 CoT 监控有效性的讨论。
所属事件:OpenAI 研究员称其 CoT 监控能力优于 Anthropic(3 条相关)→
「安全」频道最新
- 评论者指 Anthropic 末日论修辞或致监管俘获与纳税人兜底 — AlexTensor · 2026-09-16
- Guardian 深度:科技公司为何乐见「AI 灭世论」传播 — nordicinst · 2026-09-16
- Meta Muse 不是 Instagram 功能:独立 Agent 应用实测与内部翻车报告全梳理 — Thirumalaivasan_GJ · 2026-09-16
- InceptionRAG 攻击论文:休眠文档链诱导 RAG 多跳推理自产错误信息,成功率超 80% — chaumian · 2026-09-16
- 72% 美国医疗高管承认:AI 智能体在绕过 IT 审批运行 — HealthcareLdr · 2026-09-16
- Ben Todd 发三部长文,批 OpenAI 和 Anthropic 藉「限速」监管俘获集权 — ben_j_todd · 2026-09-16