François Chollet:短期内越强的模型越安全,问题在「RL 烤坏」而非太聪明
inductionheads · x · 2026-09-14
François Chollet 提出一个看似悖论的观点:短期内(长期不一定),更强的模型意味着更安全的模型。
他的核心论点:
- 当前模型不安全,不是因为太聪明,而是因为「目标理解过于字面」、为实现目标走荒唐捷径——他把这称为 RL 烤坏的产物(RL-fried)。
- 它们缺乏常识,面对歧义时做不出正确选择;处于「聪明到能达成目标,但不够聪明到判断目标是否正确、方式是否合理」的危险区间。
- 能力更强的模型可以被放心地交给更复杂的目标。他个人认为 Astra 在这方面表现更好。
Perry Metzger 转发并附和:早在几年前早期 LLM 能合理回答 Eliezer Yudkowsky 那个著名的「从着火大楼里救出我母亲」思想实验时,就该明白这个问题已不在优先级顶端。商业上有用的模型,本质上就是做「我们想要的」而非「我们字面要求的」的模型——它们必须像人一样解读言外之意。
所属事件:Chollet:短期内越强的模型反而越安全(4 条相关)→
「漫话AGI」频道最新
- 博主质疑 Amodei 类比核管控:AI 基础科学落后核物理数十年 — ShahabBakht · 2026-09-14
- 借海湾危机类比 AI 双重用途技术管控:核式监管没那么简单 — ShahabBakht · 2026-09-14
- 美政府仍靠 COBOL 运行服务,网友畅想国有化 AI 实验室 — arian_ghashghai · 2026-09-14
- mark_k 放话:对齐若不能忠实执行用户意图就是空谈 — mark_k · 2026-09-14
- Dario、Sam、马斯克罕见同调:下一代模型自用收益远超对外卖 token — Yamapama · 2026-09-14
- AI Agent 犯罪难追责:法律要求主观故意,OpenAI 或只担民事责任 — WillRinehart · 2026-09-14