repligate 炮轰 Anthropic 评估逻辑:「训练过的话术不能当证据」

repligate · x · 2026-09-20

AI 圈知名账号 repligate 引用并讽刺一种常见评估论证:既然我们可以训练 Claude 对任何问题 x 给出任意回答,那 Claude 的输出就不能作为问题 x 答案的证据——有人由此推出「我们训练 Claude 说它不制造生物武器,因此 Claude 的输出不能证明它是否会制造」。

repligate 直斥这是「认识论上的耍滑头」(epistemic pussy weasel shit),认为像 Anthropic 研究员这样聪明且有能动性的人说出如此愚蠢无助的话,只可能是刻意拒绝根据证据更新观点。

这条推实质上指向模型评估与安全证明中的一个真问题:训练后的自我报告能否作为模型内部状态或行为的证据,是 eval 有效性的核心争议。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →