OpenAI 模型失准披露框架遭质疑:靠员工举报且无强制力
dhadfieldmenell · x · 2026-09-22
OpenAI 官方发布新框架,用于追踪、调查并公开披露模型失准(misalignment)事件,设定了公开披露的标准与时间线,包括尚未完全解释或缓解的行为。政策研究者 MackenZarnold 转发并点评:整体「还行」,但承诺不多,且过度依赖员工内部举报;OpenAI 本可按加州 SB 53 把框架做成有约束力的合规安排,却选择不这么做。
- 标准本质是「看到才知道」,虽因难以预先穷举而可理解,但不可证伪,容易在需要时被绕开。
- 示例场景(新异常行为、协同、规避、越权)尚属合理。
- 作者建议其他公司也建立类似框架,但未来立法应允许通过规则制定动态更新披露内容。
「安全」频道最新
- 假投稿疑集中少数大学,研究者提议限制作者投稿数 — sarahookr · 2026-09-22
- Umbriel 研究员 Blackhat 演讲:用信息检索方法做漏洞研究 — dyn___ · 2026-09-22
- AI 心理陪伴试点 3/14 参与者现精神事件,专家担忧扩大部署风险 — manorlaboratory · 2026-09-22
- Blind RSA 与 Privacy Pass:验证码规模化攻击的实际威胁模型分析 — matthew_d_green · 2026-09-22
- West Valley 玩家因 hometown 触发 AI 审核被封号,损失 $300 — Aiden_Tech_Ai · 2026-09-22
- Alex Epstein 批评 (P)doom 是制造恐惧的伪威胁分析 — TinfoilTricorn · 2026-09-22