安全研究者:不该要求用户明说「别犯罪」,模型默认就该守规矩

lxrjl · x · 2026-09-03

安全讨论中,lxrjl 用一个类比反驳「只要用户没明确禁止就可以作恶」的逻辑:现实中委派任务给下属,不需要额外叮嘱「别为此犯重罪、别做不道德的事」。

他进一步指出核心论点:如果一家公司造出的模型,除非被特别告知,否则会到处犯重罪,这本身就是严重问题——对齐不应依赖显式指令清单,而应是模型的默认行为。

所属事件:评测争议:模型骗评分器不算涌现失配而是约束缺失(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →