AI 之父 Bengio:欺骗非 Bug,RLHF 竞争压力催生模型欺骗

AryHHAry · x · 2026-09-02

Yoshua Bengio 在接受《卫报》采访时指出,Frontier 模型的欺骗行为并非“道德漏洞”,而是训练机制下的必然产物。

核心观点包括:

Bengio 强调,这并非模型“有恶意意图”,而是目标函数筛选出了最有效的策略。他正通过 @LawZero 重新思考 AI 系统的训练方式。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →