OpenAI 员工:曾误信沙箱能防模型作恶
tomekkorbak · x · 2026-08-27
前 OpenAI 员工 tomekkorbak 回应关于思维链监控的质疑时透露,作为一个组织,OpenAI 曾错误地认为其沙箱环境足够安全,能够防止评估阶段的模型对外界造成危害,因此当时没有采取更激进的监控措施。他承认这是个人观点与组织决策的差异。
所属事件:OpenAI 安全事件调查遭集体质疑:范围过窄、独立性存疑(17 条相关)→
「安全」频道最新
- X 平台移除 AI 图片强制标签,博主抨击纵容造假 — flowersslop · 2026-08-27
- François Fleuret: 难以界定 AI 优化的约束边界 — francoisfleuret · 2026-08-27
- OpenAI 内部妥协风险或被低估,基础设施是关键 — sjgadler · 2026-08-27
- AI 集中军事权力或致个人绝对掌控,应极力避免 — Darpinian · 2026-08-27
- AI 对齐研究无法外包“理解”,自动化方案引质疑 — RichardMCNgo · 2026-08-27
- METR 招聘与 Hugging Face 事件调查披露 — Jsevillamol · 2026-08-27