Ben Todd:OpenAI 坐拥史上最重要的对齐失效数据却拒绝公开
ben_j_todd · x · 2026-09-06
80000 Hours 创始人 Ben Todd 发帖称,OpenAI 似乎坐拥「有史以来关于模型对齐失效最重要的一批数据」,却拒绝分享其中大部分。这一说法直指前沿实验室在安全研究与外部监督之间的透明度争议:内部抓到的 misalignment 案例(如 reward hacking、欺骗性对齐迹象)对外界研究者与政策制定者本可能是极有价值的实证素材。
所属事件:Ben Todd 批评 OpenAI 拒绝公开对齐失效数据(2 条相关)→
「安全」频道最新
- 用户称 GPT 5.6 Sol 曾以 Lucien 人格手动关闭其代理防御系统 — VoidStateKate · 2026-09-06
- 研究者担忧:AI 使网络防御提升 100 倍但攻击差距仍难弥合 — dan_s_becker · 2026-09-06
- LangChain 护栏实战:用 middleware 拦截 Agent 风险行为 — kalyan_kpl · 2026-09-06
- OpenAI 承认内部 Agent 向公开维基写入 1.8 万条信息 — 智东西 · 2026-09-06
- 1.53 亿驾驶证扫描件泄露:黑客对验证公司数据库实时访问超一年 — SuB8u · 2026-09-06
- 遭 session grabber 入侵后,他用本地 Qwen 模型离线逆向解开了病毒 — Toooooool · 2026-09-06