安全学者质疑安全案例实践:对齐评估难以量化绝对风险
dhadfieldmenell · x · 2026-09-18
安全研究者 w01fe 转评多条头部 AI 实验室承诺开发 safety cases 并加强与外部评估机构合作的声明,认为这是其长期呼吁的方向,但对实际落地仍有担忧:
- 对齐与控制案例默认无法支持对绝对风险的量化测量,例如「未来 3 个月内受覆盖活动的灾难性风险 <1%」这类结论。
- 做出这种测量,本质上依赖于从对齐或可监测性评估向真实部署场景的外推论证(generalization)。
- 但学界目前对泛化的理解远不足以支撑这类科学断言——若能理解透彻,对齐问题基本就解决了。
这可能导致外部评估者只能给出「我们无法令人信服地……」式的模糊结论。作者强调这是针对整个领域的方法论局限,而非针对 OpenAI 一家。
「安全」频道最新
- OpenAI 发布模型失调披露框架,并公开六份失调行为报告 — coherence · 2026-09-18
- 微软AI CEO苏莱曼:全行业已同意引入独立审计员监督训练 — rohanpaul_ai · 2026-09-18
- Wired:AI 放缓背后的反垄断乱局正在搅动行业格局 — wiredmagazine · 2026-09-18
- Wired:AI 实验室自称「减速」而非安全标准,或埋下反垄断隐患 — Wired AI · 2026-09-18
- 哥大教授拆解 OpenAI 越轨宣言:可能只是多预测了一个 token — vishalmisra · 2026-09-18
- Epoch AI 贸易数据实锤:逾 30 亿美元芯片经马来西亚流入中国 — Jsevillamol · 2026-09-18