Chollet:短期内越强的模型越安全,安全问题本质是智能问题
fchollet · x · 2026-09-13
François Chollet 提出一个反直觉判断:短期内,更强的模型应意味着更安全的模型(长期则不然)。
- 当前模型不安全不是因为太聪明,而是「被 RL 烤糊了」:把目标理解得过于字面、为达成目标走荒唐捷径
- 它们缺乏常识,面对模糊情境不会做正确的事——处于「聪明到能完成目标,但不够聪明到判断目标是否正确、方式是否合理」的危险区间
- 能力更强的模型可以被安全地托付更复杂的目标;他个人感觉 Astra 对他的代码库比 Sol 更安全
这常被框定为对齐问题,但他认为本质上是智能问题。
所属事件:Chollet:短期内越强的模型反而更安全(2 条相关)→
「漫话AGI」频道最新
- 数学家的「骆驼原则」:一条藏在常用方法背后的关键规则 — TivadarDanka · 2026-09-13
- AI 末日囤货族开始走红,"doomsday preppers" 内容疯传 — adamamcbride · 2026-09-13
- 网友互动:庆幸 AI 至今未被监管,纯智能无需恐惧 — rand_longevity · 2026-09-13
- 网友以职业生涯担保:开源模型不安全的指控是协调炮制的假象 — basedjensen · 2026-09-13
- 前 Anthropic 研究员离职帖引爆 1.7 亿浏览,Hubinger 表态 AI 十年内 10% 毁灭风险 — adamamcbride · 2026-09-13
- 自动化真正的盲区:没人写进流程里的隐性任务 — chris_j_paxton · 2026-09-13