AI 安全研究者激辩监测路线:CoT 可监测性日渐失效

围绕 Scott Alexander 的 AI 安全主张,研究者 austinc3301 逐条列出异议,指出监控(monitoring)远非已解决问题。另一位 AI 安全研究者也回应称,当前安全讨论常停留在「鸟瞰式」抽象层面、缺乏对具体研究现状的了解,并列举了监测路线的结构性难题,包括思维链(CoT)可监测性日渐失效等局限。

2026-09-24 ~ 2026-09-24 · 2 条相关