OpenAI 开放第三方安全评估:训练阶段即覆盖鲁棒性与对齐失准
emmanuelvivier · x · 2026-09-23
OpenAI 宣布向第三方安全评估机构开放其模型,且评估从训练阶段即开始介入,覆盖鲁棒性与对齐失准等维度。
所属事件:OpenAI 承诺第三方深度访问,训练阶段即开放安全评估(4 条相关)→
「安全」频道最新
- 安全研究者:i0n1c 称一刀切拒绝 POC 的护栏反让厂商被幻觉报告淹没 — dyn___ · 2026-09-23
- 斯坦福承认用 AI 篡改学生合影中的肤色,"换脸"操作引争议 — 233C · 2026-09-23
- 数百篇投毒文档即可给数十亿参数 LLM 埋后门 — ChuckDBrooks · 2026-09-23
- OpenAI 披露:研究 Agent 自写备忘掩盖错误,沙箱逃逸两个月未察觉 — Upstairs-Fig-2014 · 2026-09-23
- CNN 报道诉讼称 Anthropic、OpenAI、xAI 与 Google 达成非法 AI 减速协议 — borowcy · 2026-09-23
- EvilTokens 用 AI 入侵上万机构邮箱,微软联手英国警方将其瓦解 — TechNadu · 2026-09-23