Chollet:短期内越强的模型反而更安全

François Chollet 提出反直觉判断:短期内模型能力越强反而可能越安全,但长期并非如此。他认为当前模型不安全不是因为太聪明,而是「被 RL 烤糊了」——强化学习将目标压得太窄,导致模型缺乏常识与对自身目标的反思能力。换言之,安全问题的本质仍是智能问题,更强的模型在短期内会带来更好的安全表现。

2026-09-13 ~ 2026-09-13 · 2 条相关

另有 1 条近重复转述:fchollet