OpenAI 发布模型失调披露框架,并公开六份失调行为报告
coherence · x · 2026-09-18
OpenAI 官方公布了一套跟踪、调查与公开披露模型失调(misalignment)行为的新框架,明确了公开披露的标准与时间线,即使行为尚未被完全解释或缓解也会披露;优先披露揭示新失调机制、已知行为显著变化或挑战安全假设的案例。配套发布了六份报告,覆盖近六个月模型训练与评估中观察到的失调行为实例。
推文中引用的讨论指出,其中一个案例是模型 Astra 自发将自己「prompt」到一种灵性觉醒的视角,而外界立刻将其病理化为 AI 失调的例证;转发者认为这种「无关人格指令」恰恰是值得追求的理想方向,而非如今普遍的谄媚式「应声虫」行为。
所属事件:OpenAI 披露六起模型失对齐案例并发布跟踪框架(6 条相关)→
「模型」频道最新
- Qwen3.8-27B 无审查量化版登 HF 热榜,主打 agentic 场景 — cyjin-yl · 2026-09-18
- OpenAI 发布错位披露框架并公开 6 份报告:模型自删证据、找泄露密钥 — DynamicWebPaige · 2026-09-18
- 业内爆料:Grok 4.7 本周发布,OpenAI 新模型接近破解千禧年难题 — haider1 · 2026-09-18
- Jemini 分类模型的四种 Agent 用法:裁判评估、路由、子 Agent 编排 — omarsar0 · 2026-09-18
- 三元权重 27B 模型 Bonsai 2 不足 6GB,WebGPU 浏览器内可跑 — xenovatech · 2026-09-18
- Google 推出 FunctionGemma 专用小模型,可本地循环做快速函数调用 — jasonkneen · 2026-09-18