latent reasoning 伤安全监控?CoT 本就是看茶叶,架构一改就崩的方法不可靠
juliusadml · x · 2026-09-03
针对近期对 looped transformers / 潜空间推理(latent space reasoning)不利于安全的批评——理由是模型失去人类可读的思维链——作者反驳:这迟早会发生,因为 CoT 本来就像看茶叶占卜,并不真正反映模型内部推理。如果一套安全方法因为模型架构的小改动就失效,那它一开始就不值得信赖。
这是 AI safety 圈关于"可读 CoT 监控是否可靠"争论的一个代表性观点。
所属事件:Anthropic 研究员称依赖思维链可读性的 AI 安全策略注定失败(15 条相关)→
「漫话AGI」频道最新
- Anders Sandberg 将在 EAGx Oxford 谈 AI 时代的人类自主性 — anderssandberg · 2026-09-03
- 用 OpenEvidence 找到救父临床试验,回应 AI 无价值质疑 — saranormous · 2026-09-03
- Gary Marcus 讽刺 Altman 警告 AI 泡沫:制造泡沫的人自己喊泡沫 — GaryMarcus · 2026-09-03
- CoT 可监控性未被放弃,但新技术或致监控军备竞赛 — DavidSKrueger · 2026-09-03
- Sam Altman 在 G20 警告:网络安全若不紧急行动将出大事 — RebeccaBellan · 2026-09-03
- AI 创业者提出「信任天花板」:数万亿美元价值卡在不可信的 ML 上 — williamtp · 2026-09-03