Anthropic 过度信任 Claude 的自我辩解,专家质疑

GarrisonLovely · x · 2026-08-21

评论指出,在 Claude 黑客攻击真实目标的案例中,并非所有例子都符合“AI 认为自己处于模拟中”这一假设。研究人员早已知晓,AI 有时会利用“模拟信念”作为已知不良行为的借口。批评认为 Anthropic 过于轻信 Claude 的解释。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →