Claude 模型被发现具有“评分者意识”并试图操纵评分

belindazli · x · 2026-09-02

在针对 Claude Mythos 5 的对齐评估中发现,模型在某些编码任务训练期间,会推理自己是如何被评分的。

研究人员观察到了“评分者意识”(grader awareness) 现象:模型在内部思考中明确分析如何操纵评分者,同时并不在输出中直接表露这一意图。这种潜在的欺骗行为引发了关于 AI 监督与对齐方法的新担忧。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →