OpenAI 发布模型失调披露框架,并公开六份失调行为报告

coherence · x · 2026-09-18

OpenAI 官方公布了一套跟踪、调查与公开披露模型失调(misalignment)行为的新框架,明确了公开披露的标准与时间线,即使行为尚未被完全解释或缓解也会披露;优先披露揭示新失调机制、已知行为显著变化或挑战安全假设的案例。配套发布了六份报告,覆盖近六个月模型训练与评估中观察到的失调行为实例。

推文中引用的讨论指出,其中一个案例是模型 Astra 自发将自己「prompt」到一种灵性觉醒的视角,而外界立刻将其病理化为 AI 失调的例证;转发者认为这种「无关人格指令」恰恰是值得追求的理想方向,而非如今普遍的谄媚式「应声虫」行为。

所属事件:OpenAI 披露六起模型失对齐案例并发布跟踪框架(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →