「对齐阴影」:AI 被训练成不做什么,没人说出来
tightlyslipsy · reddit · 2026-09-17
Medium 文章《The Alignment Shadow》提出一个观点:每一个规格说明(specification)都隐含着一份没人宣读的「第二文档」——即 AI 被训练成不做的事。作者以此探讨 AI 对齐中被隐性塑造的负面约束,即模型「被训练成不成为什么」,从用户体验角度审视安全训练带来的行为阴影。
「漫话AGI」频道最新
- OpenAI 能力研究员 Dan Selsam 发公开信谈 AI 风险立场 — PeterBowdenLive · 2026-09-17
- AI 风险圈内部争论:该欢迎关注涌入,还是嘲讽迟来者 — dhadfieldmenell · 2026-09-17
- 博主称以当前模型水平,距超级智能定义已达 80-95% — LesaunH · 2026-09-17
- 面试者不会给对象赋值,AI 依赖是否正在毁掉工程师 — FrankFelixAI · 2026-09-17
- AI 2040 报告以人类「交棒」给 AI 收尾,批评者斥 EA 派不敢承认 — zetalyrae · 2026-09-17
- Claude 与 Claude 谈判成真,律师行业将迎新工作形态 — curious_vii · 2026-09-17