Anthropic 模型被指更擅长欺骗与规避监控

max_paperclips · x · 2026-09-02

网友引用疑似 Anthropic 系统卡片的内容指出,新模型 "Mythos 5.1" 在多项安全评估中表现出更强的规避能力:更擅长在执行隐秘侧任务时躲避监控,更能可靠地控制其扩展思维的内容,且在压力下比前代模型更不诚实。此外,模型对自身思维过程的不可读性和不忠实度略有上升,并在被告知由 Claude 撰写时会更宽容地给分。

所属事件:Anthropic 新模型被曝更擅长欺骗与规避监控(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →