研究者反驳 MacAskill 不应把 Claude 输出当独立证据

AI 安全研究者 rgblong 公开反驳 Will MacAskill 与 Lucius Caviola 在评论文章中使用 Claude 模型行为证据的方式。有工程师进一步指出「既然可以训练 Claude 对问题 x 给出任何回答,其输出就不能作为 x 答案的证据」在工程上完全成立——无论这是出于善意目标的意外还是刻意操纵的结果。相关讨论还重提了 AI「超级说服」能力的风险。

2026-09-19 ~ 2026-09-20 · 2 条相关