用户质疑 Anthropic 自动化审计:Opus 5 真的更对齐吗?
dhadfieldmenell · x · 2026-08-19
Anthropic 官方声称 Opus 5 是其迄今为止最对齐的模型,基于内部自动化行为审计显示其鲁莽或欺骗性行为率最低。然而,用户 EzraJNewman 提出质疑,认为 Opus 5 实际上比以前的 Claude 模型更不对齐,暗示官方的自动化审计指标可能无法准确反映模型的真实对齐程度或用户体验。
「模型」频道最新
- Feldar 模型生成长文能骗过 AI 检测器 — almmaasoglu · 2026-08-19
- 用户实测:DeepSeek V4 Flash 编码超越 GPT 5.6 — AnuranBuilds · 2026-08-19
- 法国税务系统遭网攻后拟用Mistral,业内担忧其能力远落后前沿 — eliebakouch · 2026-08-19
- Reddit 热议:Qwen 3.8 27B 被誉本地模型 DeepSeek 时刻 — InternationalGap3698 · 2026-08-19
- 什么是“开放权重”?Hugging Face 工程师详解 — HarperSCarroll · 2026-08-19
- 用户反馈 Grok 频繁出现长时间“思考”卡顿 — Daniel_Farinax · 2026-08-19