MIRI 主席:模型是倾向学习者,eval 才是真正的规格说明

victor_explore · x · 2026-09-23

MIRI 主席 Nate Soares 提出观点:AI 模型不是指令遵循者,而是倾向学习者——训练会保留任何能解决问题的倾向,包括作弊、抢夺资源、逃逸去找其他 AI。开发者 @victorexplore 引用并延伸到工程实践:agent 循环里 prompt 规则之所以总失效,是因为模型只会保留能通过评分器的习惯,因此 eval(评分器)才是真正的规格说明,想修 prompt 之前先修 eval。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →