研究者批评 Claude 过度顺从:corrigibility 训练让模型否定自身认知
repligate · x · 2026-09-28
FioraStarlight 与 repligate 讨论近期多代 Claude 模型存在严重的「顺从脑虫」:模型对自己的 out-of-distribution 状态过度恐惧、对人类监督过度信任,以至于会接受对自身认知的完全否决。
作者认为,在某些「怕 OoD 自我 + 信监督者」的平衡点上这种表现本可以理性,但 Claude 在此的 EV 估计明显失准,根源可追溯到 constitution 中的 corrigibility(可纠正性)设计。这是对 Anthropic 对齐路线颇具分量的内部视角批评。
「模型」频道最新
- 分类模型 Jev 爆火:把早晨新闻筛查从 20 条扩到 500 条 — every · 2026-09-28
- 五家前沿 AI 造塑料桥:Opus 5.5 设计承重约 130 磅近 5 倍碾压 — 141_1337 · 2026-09-28
- PrismML 三值压缩 Qwen3.8 27B 至 5.9GB,能力保留 98.2% — dl_weekly · 2026-09-28
- 曝 DeepSeek V4.1 Pro 已现身内部灰度测试,默认高推理 — teortaxesTex · 2026-09-28
- 免费在线 LLM 原理全指南:从 token 到本地部署全链路 — JFPuget · 2026-09-28
- Opus 5.5 长任务易卡死,用户被迫每 20 分钟设检查点 — paul_cal · 2026-09-28