NeelNanda 与安全研究者激辩:中国开源模型绕过对齐护栏的风险
robleclerc · x · 2026-10-05
对齐研究员 Neel Nanda 与网友就前沿模型安全展开交锋:他担忧西方让 AGI 落入中国手中,但认为实验室正在制造「超人类黑客」能力却不懂得如何控制,当前做法风险很大。
robleclerc 回应称:在安全护栏存在时实验室还能控制模型,一旦撤掉就会失控;实验室正尝试在无护栏状态下研究对齐,但中国的开源权重模型不会提供同样的保护。他还引「古格斯之戒」隐喻:正如许多人会滥用隐身能力,没有护栏的模型可能本质上无法对齐。
「漫话AGI」频道最新
- 研究者:谈 AI 安全别依赖常识,大脑在此领域天生不适配 — austinc3301 · 2026-10-05
- Chollet vs 同行激辩:否认 AI 有感知是「该弃守的阵地」吗 — austinc3301 · 2026-10-05
- 基因组学家说 AI 是世界模型,药物化学家说它只是流程编排器 — shyamalanadkat · 2026-10-05
- 工程师批评 OpenAI 把进度置于安全之前:未验证代码出事将面临追责 — gerardsans · 2026-10-05
- 斯坦福学者论战组学图谱:单独没用,配 AI 模型才能挖出生物学 — anshulkundaje · 2026-10-05
- gfodor:AI 时代的两大失败模式是高估理解需求与假装自己懂 — sebpaquet · 2026-10-05