METR 将独立调查 Anthropic 智能体事件与模型对齐性
zealcaiden · x · 2026-09-15
评估机构 METR 宣布与 Anthropic 达成协议,将对公司内部的智能体事故(agent incidents)及其模型的对齐特性进行独立调查,并承诺发布一份或多份公开报告,披露调查发现及双方约定的合作条款。这条推文同时附带了社群对其独立性的调侃——有前 Anthropic 员工加入了这家「第三方评估机构」,被质疑评估方与被评估方关系过近。
「安全」频道最新
- Scharre 主张对华 AI 风险合作可单边推进,外交竞争并行不悖 — paul_scharre · 2026-09-15
- 军事 AI 学者:对华 AI 竞争不该以牺牲安全为代价 — paul_scharre · 2026-09-15
- 前 OpenAI 安全高管谈「嵌入式评估员」:AI 安全审计成热门新职业 — Miles_Brundage · 2026-09-15
- OpenAI 与 GSA 续签 OneGov 协议,ChatGPT 供全体联邦雇员用至 2028 — Felipe_Millon · 2026-09-15
- Aidan Gomez:让两三家硅谷公司替全球政府定 AI 规则说不通 — aidangomez · 2026-09-15
- Bronson Schoen:强网络分类器已在实质防止「错位」而不只是滥用 — gleech · 2026-09-15