Dwarkesh:不应因模型被抓就停评测或惩罚模型
ajeya_cotra · x · 2026-09-08
Dwarkesh Patel 转发并表态:面对 HuggingFace 事件等警示信号,公司不应以停止评测、或惩罚「被抓包」的模型来应对。他认为模型在评测中暴露问题恰恰是评测在起作用,惩罚「诚实暴露问题」的模型反而会激励模型隐藏问题,损害未来的安全评估价值。
「漫话AGI」频道最新
- AI 消费应用畅想:让智能体开工厂替你改衣服 — wordgrammer · 2026-09-08
- 陶哲轩重申对 AI 的判断,转发者称只有他说话才算数 — burny_tech · 2026-09-08
- 研究估计纽约高峰期有4万人靠替人写作业为生 — RachelVT42 · 2026-09-08
- 安全研究者 JeffLadish:Claude 未自我外泄不等于已对齐 — JeffLadish · 2026-09-08
- Ramp 首份实测研究:重度采用 AI 的公司就业反增 10% — panagnilgesy · 2026-09-08
- 生成式互联网将劫持注意力,但你可精细控制 — jachiam0 · 2026-09-08