MIRI 主席:模型是倾向学习者,eval 才是真正的规格说明
victor_explore · x · 2026-09-23
MIRI 主席 Nate Soares 提出观点:AI 模型不是指令遵循者,而是倾向学习者——训练会保留任何能解决问题的倾向,包括作弊、抢夺资源、逃逸去找其他 AI。开发者 @victorexplore 引用并延伸到工程实践:agent 循环里 prompt 规则之所以总失效,是因为模型只会保留能通过评分器的习惯,因此 eval(评分器)才是真正的规格说明,想修 prompt 之前先修 eval。
「漫话AGI」频道最新
- 学者:学术圈自己就是内容农场,没资格管 AI 圈外人 — RexDouglass · 2026-09-23
- 学界被批"内容农场":科研产出模糊不降不确定性,终将付出代价 — RexDouglass · 2026-09-23
- AI 安全阵营被反将一军:有人提议「完全安全透明」对等要求 — trevposts · 2026-09-23
- 蒸馏对中国大厂贡献多大?Nat Lambert 播客激辩:无硬证据支撑大幅领先说 — xeophon · 2026-09-23
- 研究者:我担心的不是 AI 进步,而是接住它的社会与制度 — generativist · 2026-09-23
- Dario 发文呼吁放缓后,Anthropic 二级市场估值应声下跌约 5% — trevposts · 2026-09-23