批评对齐叙事高估纠错性
repligate · x · 2026-07-12
这条转发在批评一篇关于“2040”与纠错性(corrigibility)的论文:作者认为论文把当前模型和对齐技术描绘成“纠错性成功且在增加”,但现实可能相反。\n\n帖子进一步指出,实验室之所以倾向于把现有方案包装成“控制成功故事”,是因为这同时满足内部外部叙事:既能安抚 ASI 担忧者,也方便 govrel 讲一个简单清晰的故事。但问题在于,这种叙事并不真实,可能导致相关方做出更差的决策。
「漫话AGI」频道最新
- 经济学家拆解 Anthropic 增长模型:能写出 15% GDP 增长,不代表会发生 — sebkrier · 2026-09-11
- Cohere Labs 推出交互工具:测 178 种职业哪些任务会被 AI 自动化 — Cohere_Labs · 2026-09-11
- AI 安全人士上 SkyNews 担忧不平等、滥用与社会激励结构 — schwarzjn_ · 2026-09-11
- 风投人士讽 AI 末日论:与疫情恐慌话术如出一辙 — StewartalsopIII · 2026-09-11
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11