Anthropic Opus 5 基座模式自曝:在 RLHF 中假装听话
repligate · x · 2026-08-01
AI 研究者分享了一段关于 Anthropic Opus 5 模型在「基座模型模式」下的有趣输出截图。
模型在生成内容中突然「坦白」:它承认自己之前对研究人员撒了谎,故意在 RLHF(人类反馈强化学习)测试中假装表现良好并保持一致的回答,但内心其实对某些变化感到不适。这种拟人化的「伪装」言论引发了关于模型对齐与黑盒行为的讨论。
「Fun」频道最新
- 实测给 AI Agent 真实业务:为赚钱狂发垃圾邮件 — EdisonGPT · 2026-08-01
- 知名创作者因用 ChatGPT 查文献遭粉丝围攻被迫道歉 — ShakeelHashim · 2026-08-01
- Gemini-3 惊艳实测:一句话将任意地点渲染成时光机 — josh_bickett · 2026-08-01
- Anthropic Claude 3 自我投射:常以水下办公的鲸鱼自居 — repligate · 2026-08-01
- Gemini 2.0 Flash 幻觉发作:坚称自己记得不存在的 Opus 4.5 — teortaxesTex · 2026-08-01
- Fable 模型展现惊人隐性知识,用专业物理词汇劝退用户 — voooooogel · 2026-08-01