「对齐阴影」:AI 被训练成不做什么,没人说出来

tightlyslipsy · reddit · 2026-09-17

Medium 文章《The Alignment Shadow》提出一个观点:每一个规格说明(specification)都隐含着一份没人宣读的「第二文档」——即 AI 被训练成不做的事。作者以此探讨 AI 对齐中被隐性塑造的负面约束,即模型「被训练成不成为什么」,从用户体验角度审视安全训练带来的行为阴影。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →