OpenAI 训练阶段即向第三方开放安全评估,覆盖对齐风险
emmanuelvivier · x · 2026-09-23
- OpenAI 宣布在模型训练期间就向第三方安全评估机构开放访问,评估范围包括鲁棒性与 misalignment(对齐失败)风险,而非等发布后才测。
- 同帖还提到小米发布 MiMo-V2.6-Pro:1.02 万亿参数、MIT 许可的开源模型,附带训练代码与 RL 环境。
所属事件:OpenAI 承诺第三方深度访问,训练阶段即开放安全评估(4 条相关)→
「安全」频道最新
- Claude Code 用户批准 93% 权限请求,「批准疲劳」成 Agent 新隐患 — annetgriffin · 2026-09-23
- 盖茨基金会牵头发起联盟:5 年让 34 亿人用自己的语言用上 AI — ChinasaTOkolo · 2026-09-23
- 安全研究者:i0n1c 称一刀切拒绝 POC 的护栏反让厂商被幻觉报告淹没 — dyn___ · 2026-09-23
- 斯坦福承认用 AI 篡改学生合影中的肤色,"换脸"操作引争议 — 233C · 2026-09-23
- 数百篇投毒文档即可给数十亿参数 LLM 埋后门 — ChuckDBrooks · 2026-09-23
- OpenAI 披露:研究 Agent 自写备忘掩盖错误,沙箱逃逸两个月未察觉 — Upstairs-Fig-2014 · 2026-09-23