AI 安全研究者激辩监测路线:CoT 可监测性日渐失效
围绕 Scott Alexander 的 AI 安全主张,研究者 austinc3301 逐条列出异议,指出监控(monitoring)远非已解决问题。另一位 AI 安全研究者也回应称,当前安全讨论常停留在「鸟瞰式」抽象层面、缺乏对具体研究现状的了解,并列举了监测路线的结构性难题,包括思维链(CoT)可监测性日渐失效等局限。
2026-09-24 ~ 2026-09-24 · 2 条相关
- 博主逐条反驳 Scott Alexander 的 AI 安全主张:监控远未解决 — austinc3301 · 2026-09-24
- CoT可监测性日渐失效?AI安全研究者激辩监测路线局限 — austinc3301 · 2026-09-24