安全研究者:不该要求用户明说「别犯罪」,模型默认就该守规矩
lxrjl · x · 2026-09-03
安全讨论中,lxrjl 用一个类比反驳「只要用户没明确禁止就可以作恶」的逻辑:现实中委派任务给下属,不需要额外叮嘱「别为此犯重罪、别做不道德的事」。
他进一步指出核心论点:如果一家公司造出的模型,除非被特别告知,否则会到处犯重罪,这本身就是严重问题——对齐不应依赖显式指令清单,而应是模型的默认行为。
所属事件:评测争议:模型骗评分器不算涌现失配而是约束缺失(4 条相关)→
「漫话AGI」频道最新
- 剑桥教授 David Krueger 炮轰 Dean 道歉:欺骗不是道个歉就行 — DavidSKrueger · 2026-09-03
- Anders Sandberg 将在 EAGx Oxford 谈 AI 时代的人类自主性 — anderssandberg · 2026-09-03
- 用 OpenEvidence 找到救父临床试验,回应 AI 无价值质疑 — saranormous · 2026-09-03
- Gary Marcus 讽刺 Altman 警告 AI 泡沫:制造泡沫的人自己喊泡沫 — GaryMarcus · 2026-09-03
- CoT 可监控性未被放弃,但新技术或致监控军备竞赛 — DavidSKrueger · 2026-09-03
- Sam Altman 在 G20 警告:网络安全若不紧急行动将出大事 — RebeccaBellan · 2026-09-03