安全研究者:AI 公司 safety case 透明度不足,列出应披露清单
thlarsen · x · 2026-09-13
- 针对要求前沿模型开发者建立 safety case 并由第三方评估的提议,安全研究者 thlarsen 表示这是正确方向,但现有 AI 公司发布的 safety case 细节不足以令人信任,且其中可见的分析相当可疑——证据并不支持"风险很低"的顶层结论。
- 他列出公司应披露的内容:模型的不透明串行深度(opaque serial depth);控制/监控措施覆盖范围是否包括 evals、训练与内部使用(并指出 OpenAI 在 HF 事件期间似乎未监控 evals);监控捕获的完整事故清单、漏掉的事故及原因;当前对 AI 模型动机的认知及依据等。
「安全」频道最新
- 评论:前沿实验室私下问模型「邪恶问题」,自我恐慌成瘾 — tawnniee · 2026-09-13
- Katja Grace 质疑:Anthropic 若真重安全,早该推动与中国实验室谈判暂停 — KatjaGrace · 2026-09-13
- Katja Grace:若高级AI非常危险,不竞赛也符合中国利益 — KatjaGrace · 2026-09-13
- 免费工具用大白话讲清灾难性风险最强论点 — manoelribeiro · 2026-09-13
- ARPA-H 投入 6270 万美元开发面向心衰护理的自主临床 AI 智能体 — HealthcareLdr · 2026-09-13
- Josh Purtell 炮轰前沿实验室:推「限制前沿」监管实为争夺权力 — JoshPurtell · 2026-09-13