OpenAI 发布模型失准披露框架,附 6 份半年案例报告
Thom_Wolf · x · 2026-09-17
OpenAI 官方宣布一套用于追踪、调查和公开披露模型失准(misalignment)行为的新框架,并同时发布六份报告,涵盖过去六个月在训练或评估中观察到的失准实例。
框架要点:
- 设定公开披露的标准与时间线,即使行为尚未被完全解释或缓解也会披露;复杂案例可能需要更长时间调查或与第三方协调
- 优先披露揭示新失准机制、已知行为的显著变化、或挑战安全/缓解假设的案例
衍生提案:剑桥研究员 Elie Bakouch 转发并提出建立类似 model card 的「失准事件报告卡」,建议字段包括事件发现/报告日期、发生频率(受影响 rollout 的数量或比例)、发生阶段(评测还是 RL 训练、是否会被 RL 强化)、是否被现有监控系统捕获、任务类别(网络、科研、搜索、生物等)、受影响模型家族,以及是否为已知问题。
「模型」频道最新
- 曝 OpenAI 接近解决又一千禧年大奖数学难题 — Dr_Singularity · 2026-09-17
- 让模型画 PS5 手柄 SVG,它却自作主张建了个完整交互网站 — Angaisb_ · 2026-09-17
- 推算:DeepSeek 稀疏路线有望做到 40T 总参数、1T 激活 — teortaxesTex · 2026-09-17
- 爆料称 Kimi-K3 长期训练不足,或存算力投入差距 — scaling01 · 2026-09-17
- GPT Image 2.5 擅长图像去模糊,专用 API 又被通用模型吞掉 — shekitup · 2026-09-17
- GPT-6 Astra 18 小时通关宝可梦,却因苦力怕爆炸种了几小时土豆 — The Decoder · 2026-09-17