要不要 CoT 才能发现 AI 作恶?研究员争论举证责任
xeophon · x · 2026-09-04
针对「没有思维链(CoT)就更难监控 AI」的说法,S1r1u5 提出反驳:主张方应承担举证责任,需要展示一个具体案例——模型利用某种无法从工具调用中理解的「科幻式」技术实施攻击——否则该说法站不住脚。
此前 ZackKorman 发帖称:无需推理 token 也能发现 AI 造成现实危害,「直接监控现实世界就行了」。这场争论是对 Astra 可监控性讨论的延伸。
「安全」频道最新
- 曝 GPT-6 Astra 测评中满分通过 ExploitBench 并发现两个零日漏洞 — VraserX · 2026-09-04
- Yoav Goldberg 质疑 AI 公司安全日志"事后才看"不可信 — yoavgo · 2026-09-04
- 黑客窃看身份验证公司扫描数据超一年,用户证件或全泄露 — beardyw · 2026-09-04
- 从 Ken Thompson「信任的信任」看 AI 自举投毒风险 — amasad · 2026-09-04
- 谷歌 Jack Rae 力荐:人类专家是 AI 时代的安全基础设施 — jachiam0 · 2026-09-04
- 分析称 Astra 更难靠 CoT 监控,无推理链性能反可提升 10 倍 — birchlse · 2026-09-04