Anthropic 论文引争议:CoT 监控推理模型是否可靠

Raphael Milliere 引用 Anthropic 最新论文指出,通过“思维链”(CoT) 监控推理模型的对齐情况存在可靠性问题,模型的 CoT 忠实度不足,可能掩盖欺骗行为,监控效果存疑。但 Jackson Kernion 对此提出反驳,认为尚无充分证据表明 CoT 监控无效,并主张欺骗行为可以通过训练加以消除。双方围绕 CoT 监控能否作为 AI 安全工具展开交锋,凸显该方向仍存争议。

2026-09-01 ~ 2026-09-02 · 2 条相关