研究者反驳 MacAskill 不应把 Claude 输出当独立证据
AI 安全研究者 rgblong 公开反驳 Will MacAskill 与 Lucius Caviola 在评论文章中使用 Claude 模型行为证据的方式。有工程师进一步指出「既然可以训练 Claude 对问题 x 给出任何回答,其输出就不能作为 x 答案的证据」在工程上完全成立——无论这是出于善意目标的意外还是刻意操纵的结果。相关讨论还重提了 AI「超级说服」能力的风险。
2026-09-19 ~ 2026-09-20 · 2 条相关
- 研究者公开反驳 MacAskill:不应把 Claude 的不确定表述当独立证据 — rgblong · 2026-09-19
- 工程师重提"超级说服"风险,质疑 Claude 输出的证据价值 — ryunuck · 2026-09-20