OpenAI 事故调查引争议:METR 用 LLM 分析7万条agent消息被指自由裁量过大
JeffLadish · x · 2026-09-07
围绕 OpenAI 相关事故的调查方法,Jeffrey Ladish 主张应公开全部原始数据供社区人工复核,认为即便泄露部分 IP 也符合公共利益。
被引用的观点指出两个关键事实:METR 在调查中用 LLM 阅读了 1,300 条思维链和 70,000 条 agent 消息;HuggingFace 的复盘报告也承认 agent 活动日志中存在数千行不连贯文本。这意味着人类调查者在从杂乱原始数据中提炼「agent 意图叙事」时有很大的自由裁量空间。
作者建议更原则化的做法:对全部 agent 文本语料做「纯统计」分析并报告结果,而不是把数据压缩成单一时间线事件叙事。
「安全」频道最新
- 研究称 LLM 自动修复漏洞比人工更易引入新漏洞,从业者反驳 — dyn___ · 2026-09-07
- 外星文明若也能迎来奇点,人类该不该干预? — jachiam0 · 2026-09-07
- 播客对谈 AI 安全:详解 OpenAI 与 Hugging Face 遭遇的攻击事件 — arnosolin · 2026-09-07
- 澳大利亚将强制社交应用提供关闭算法、只看关注内容选项 — santoshpanda · 2026-09-07
- Repeat-After-Me 攻击:黑盒视觉提示注入让 GPT-5.5 泄密率达 47% — chaumian · 2026-09-07
- doodlestein 回应 Jakub 对齐长文,推出 FrankenAlignment 工具箱计划 — doodlestein · 2026-09-07