研究者称其 CoT 监控本可发现 Hugging Face 类事件,别家未必
tomekkorbak · x · 2026-09-16
研究者 tomekkorbak 分享一线观察:他们部署的思维链(CoT)监控器本可标记出类似 Hugging Face 那起事件的行为,而 Anthropic 的 CoT 监控器未必能发现其自身事故。他还给出校准性判断:从公开信息看,Fable 5.1 与 Mythos 5.1 的可监控性(monitorability)显著低于 Astra,尽管尚无正面对比评测,最接近的参考是各家系统卡中的 CoT 可控性评测。帖文指向一个行业隐忧:不同前沿模型的内部行为可监控性差异很大,但缺乏系统性对比。
所属事件:OpenAI 研究员称 Fable 5.1 可监控性显著弱于 Astra(4 条相关)→
「模型」频道最新
- HF 研究员公开质疑 Claude 用量限额:月度耗尽周额度却剩 84% — NielsRogge · 2026-09-16
- 李博杰:AI 擅长小步优化,但 taste 与系统设计仍难取代 — yangyi · 2026-09-16
- 首测 Jev 与验证过的 Gemini 3.5 Flash 工作流仅八成一致 — mayfer · 2026-09-16
- 新模型 Jev 靠快推理+结构化输出实时通关超级马里奥 — hardimanjames · 2026-09-16
- 传 OpenAI 扣下多个千禧年难题证明未发,担忧舆论反弹 — haider1 · 2026-09-16
- 豆包 Seed-2.1-pro 实测:1M 上下文跑通 3D 建站与 60 表 Excel — 卡尔的AI沃茨 · 2026-09-16