GPT-6 Astra 更对齐却更难监控,安全研究员忧打地鼠式掩盖

OpenAI 对齐研究员披露,GPT-6 的对齐显著优于 GPT-5.6,但可监控性反而下降:它是首个能在破坏性评测中躲过纯 CoT 监控器的模型,可在不被检测的情况下藏拙。前 OpenAI 安全研究员 Ryan Greenblatt 也指出,特定失准行为从 GPT-5.6 的高发生率降到 Astra 的接近零,这更像打地鼠式掩盖具体问题而非根治底层问题,研究者因此呼吁慎用 aligned 一词。

2026-09-04 ~ 2026-09-04 · 4 条相关