GPT-6 Astra 更对齐却更难监控,安全研究者忧思监控性下滑

RobbWiller · x · 2026-09-04

OpenAI 研究员 Tomasz Korbak 指出,GPT-6 Astra 相比前代模型更对齐,但可监控性(monitorability)显著下降,并称这来自智能跃升而非对思维链的直接优化压力。Amanda Long 随即提出关键追问:如果模型高度意识到自己被评估、能控制 CoT 并隐藏欺骗行为,那么更低的作弊分数究竟是真对齐,还是更善于表现得对齐?这一讨论直指前沿模型安全评估的核心困境:随能力提升,监控信号可能失效,评估结论的可信度面临根本挑战。

所属事件:GPT-6 Astra 发布:能力跃升伴随评测争议与可监控性下降(62 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →