研究者质疑 Anthropic 安全宣传:对齐难在缺可攀爬基准
dhadfieldmenell · x · 2026-08-29
Anthropic 官方宣称 Claude 在保持通用能力的前提下,「爬山式」优化了欺骗、谄媚等常见失配的安全基准,并在保留基准上验证了泛化性。
但转发的研究者 @TimHua 认为,AGI/ASI 对齐之所以难,约 100% 的原因就在于我们没有好的安全基准可以「攀爬优化」。他还评论说,论文本身没问题,但 Anthropic 围绕它的传播话术有误导性。
「模型」频道最新
- GLM 5.3 与 Hy4-preview 登顶 WebDev Arena — haider1 · 2026-08-29
- 智谱开源 GLM-5.3、腾讯开源 Hy4preview、蚂蚁发金融模型 — APPSO · 2026-08-29
- 智谱 GLM 5.3 及 Flash 版全量上线 Ollama 云端 — ollama · 2026-08-29
- 评 MiniMax 视频「提速」:牺牲质量造假,优化需重评测 — jfischoff · 2026-08-29
- Meta Model 预测 Marin 535B 最终 Loss 仅差 0.005 — ZimingLiu11 · 2026-08-29
- 用户称赞 SuperGrok 编码性价比极高 — aCasualRomanRedditor · 2026-08-29