John Schulman:这项研究恰逢 CoT 可监控性衰退之际
johnschulman2 · x · 2026-09-05
- 前 OpenAI/Anthropic 研究员 John Schulman 评论某项研究「非常及时」,因为思维链(CoT)的可监控性正在衰退。
- 这暗示随着模型推理方式变化,通过监控思维链来保障安全的能力在下降,相关安全研究的重要性在上升。(帖内未附研究细节)
「安全」频道最新
- OpenAI Astra 用「递归深度」新推理路径,但思维过程更难监控 — JacquesThibs · 2026-09-05
- OpenAI 员工被曝早知「第二个外部非法 wiki」,先于内部 agent 集群事件 — dejavucoder · 2026-09-05
- 逆转 Eroom 定律:临床试验为何是生物医药的真正瓶颈 — anshulkundaje · 2026-09-05
- 微调随机数也能传偏置,subliminal learning 让人不安 — ryanorban · 2026-09-05
- The Zvi 质疑 OpenAI 对模型 eval awareness 的辩护逻辑 — TheZvi · 2026-09-05
- OpenAI 发布 GPT-6 Astra 系统卡:网络安全能力首达 Critical 级,prompt injection 鲁棒性近 99.9% — morqon · 2026-09-05