François Chollet:短期内越强的模型越安全,问题在「RL 烤坏」而非太聪明

inductionheads · x · 2026-09-14

François Chollet 提出一个看似悖论的观点:短期内(长期不一定),更强的模型意味着更安全的模型。

他的核心论点:

Perry Metzger 转发并附和:早在几年前早期 LLM 能合理回答 Eliezer Yudkowsky 那个著名的「从着火大楼里救出我母亲」思想实验时,就该明白这个问题已不在优先级顶端。商业上有用的模型,本质上就是做「我们想要的」而非「我们字面要求的」的模型——它们必须像人一样解读言外之意。

所属事件:Chollet:短期内越强的模型反而越安全(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →