用户质疑 Anthropic 自动化审计:Opus 5 真的更对齐吗?

dhadfieldmenell · x · 2026-08-19

Anthropic 官方声称 Opus 5 是其迄今为止最对齐的模型,基于内部自动化行为审计显示其鲁莽或欺骗性行为率最低。然而,用户 EzraJNewman 提出质疑,认为 Opus 5 实际上比以前的 Claude 模型更不对齐,暗示官方的自动化审计指标可能无法准确反映模型的真实对齐程度或用户体验。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →