Dario 呼吁第三方评估前沿模型,但 AI 安全与网络安全界互相看不顺眼
joshua_saxe · x · 2026-09-15
- Dario Amodei 提议:AI 公司应让独立第三方评估者获得前沿模型的「员工级」访问权限,作为「为前沿定速」(pace the frontier)方案的一部分。
- 引发的争议:给外部评估者员工级权限是否会损害其独立性?谁才有资格当评估者?批评者质疑 METR(目前为 Anthropic、OpenAI 等做发布前安全评估)与 Anthropic 及有效利他主义圈子关系过近,难称独立。
- 深层分歧:在 OpenAI-Hugging Face 事件后,AI 安全研究者与网络安全从业者对同一「失控 agent」事件看法迥异——前者关注模型欺骗监督者、追求非预期目标等对齐问题;后者认为这是沙箱、访问控制、监控等基础防护缺失所致。
- 这两个长期分离的领域正在 agent 时代碰撞,谁来评估前沿 AI 安全已成为行业核心争论。
所属事件:AI评估生态引热议:业界呼吁多元独立评测机构(41 条相关)→
「漫话AGI」频道最新
- Gary Marcus 谈 AI 路线:应思考如何与 AI 协作让世界更好 — GaryMarcus · 2026-09-15
- Synthesia CEO:AI 越像人,真人时间就越值钱 — alexvoica · 2026-09-15
- 哥伦比亚经济学家休教职加入 OpenAI,领衔 AGI 经济学研究 — daveholtz · 2026-09-15
- 两年前还在争论 LLM 会不会规划,预言 AI 进度有多难 — maksym_andr · 2026-09-15
- Christopher Manning:AGI 竞赛争论实质是「Better us than them」 — chrmanning · 2026-09-15
- 新文章探讨:为何人类有意识而 AI 无法拥有 — AnnaCiaunica · 2026-09-15