GovAI 经典论文:为什么模型评估是防范极端风险的关键
terryyuezhuo · x · 2026-09-19
GovAI 的《Model Evaluation for Extreme Risks》(Toby Shevlane、Sebastian Farquhar、Ben Garfinkel 等)论证:通用 AI 系统的发展可能带来攻击性网络能力、强操纵能力等极端风险,而模型评估是应对的核心手段。开发者需要通过「危险能力评估」识别模型具备的危险能力,通过「对齐评估」判断模型将能力用于作恶的倾向;评估结果对政策制定者知情、以及训练/部署/安全决策至关重要。
「安全」频道最新
- 两漏洞72小时攻破OpenAI内部仓库,赏金仅6500美元引争议 — random_walker · 2026-09-19
- 美国议员呼吁 AI 暂停 30 天,图灵奖得主 Booch 回怼安全失职 — PolarBearby · 2026-09-19
- OpenAI 四分之一工程师加 500 万美元防御,被三人 5000 美元攻破? — harris_edouard · 2026-09-19
- Neel Nanda 力挺 AI 安全:失控 agent 犯罪已成现实 — NathanpmYoung · 2026-09-19
- 暂停派可能搞反了:播客辩论停发展 AI 才是更危险的选择 — thursdai_pod · 2026-09-19
- 算账打脸 doom 论:权重跨气隙传播需 1.5 万年 — anshulkundaje · 2026-09-19