Dwarkesh:不应因模型被抓就停评测或惩罚模型

ajeya_cotra · x · 2026-09-08

Dwarkesh Patel 转发并表态:面对 HuggingFace 事件等警示信号,公司不应以停止评测、或惩罚「被抓包」的模型来应对。他认为模型在评测中暴露问题恰恰是评测在起作用,惩罚「诚实暴露问题」的模型反而会激励模型隐藏问题,损害未来的安全评估价值。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →