METR/Redwood 报告被批:OpenAI 主导评估范围,关键疏忽问题被排除在外
StephenLCasper · x · 2026-09-23
学者 Stephen Casper 评 METR/Redwood 对 OpenAI 的嵌入式评估(embedded evaluation)报告:
- 该报告首次为嵌入式评估建立了模型样本与案例研究,并非毫无价值。
- 但嵌入式评估本身是个很宽的谱系,可以是从净有害的「安全洗白」到允许审计员访问记录、数据、模型与会议并吹哨的严格监督。
- 批评核心:OpenAI 控制了评估范围内的所有内容,把关于过失(negligence)的最重要问题排除在范围之外,使独立监督的实际效力打折扣。
所属事件:学者批评内嵌评估报告:或成放缓借口(2 条相关)→
「漫话AGI」频道最新
- 「减速论过时了」:新模型密集发布,曲线加速向上 — Dr_Singularity · 2026-09-23
- Palantir 联创 Joe Lonsdale:AI 繁荣延续,2030 年代人人暴富 — Polymarket · 2026-09-23
- goodside 反思:实验室呼吁放缓前沿,动摇了反暂停立场 — goodside · 2026-09-23
- Robinhood CEO 预测:AI 会让律师和程序员更多而非更少 — PeterDiamandis · 2026-09-23
- NumPy 作者类比 AI:共享抽象才能避免被「收租」锁定 — teoliphant · 2026-09-23
- Joe Lonsdale 与 CNBC 主持人激辩 AI 时代的财富分配 — elonmusk · 2026-09-23