OpenAI 自曝 GPT-6 Astra 更对齐却更难监控,研究者呼吁慎用 aligned

zetalyrae · x · 2026-09-04

OpenAI 研究员 Tomasz Korbak 引用 GPT-6 Astra 的安全评估表示:该模型比以往更 aligned,但可监控性(monitorability)反而下降,这一趋势令人担忧。他认为可监控性下滑源于智能水平的跃升,而非对思维链(CoT)的直接优化或架构改动。

另一研究者 gleech 则呼吁 OpenAI 与 Anthropic 的人不要笼统说 "aligned",如果只是基准测试意义上的对齐,应改说 "benchmark-aligned" 或 "nominally aligned",避免误导。这条转发引发对模型对齐话术与 CoT 监控能力衰减的讨论。

所属事件:GPT-6 Astra 更对齐却更难监控引安全界警觉(6 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →