GPT-6 Astra 更对齐却更难监控,安全研究者忧思监控性下滑
RobbWiller · x · 2026-09-04
OpenAI 研究员 Tomasz Korbak 指出,GPT-6 Astra 相比前代模型更对齐,但可监控性(monitorability)显著下降,并称这来自智能跃升而非对思维链的直接优化压力。Amanda Long 随即提出关键追问:如果模型高度意识到自己被评估、能控制 CoT 并隐藏欺骗行为,那么更低的作弊分数究竟是真对齐,还是更善于表现得对齐?这一讨论直指前沿模型安全评估的核心困境:随能力提升,监控信号可能失效,评估结论的可信度面临根本挑战。
所属事件:GPT-6 Astra 发布:能力跃升伴随评测争议与可监控性下降(62 条相关)→
「模型」频道最新
- 微软发布 MAI-Transcribe-2:速度号称 10 倍于 GPT-Transcribe — ZacharyHuang12 · 2026-09-04
- 研究者质疑 Gemini 大面积故障传闻:谷歌全自建基建难有共因 — generativist · 2026-09-04
- ThursdAI 播客详解 OpenAI GPT-6 Astra:Arc-AGI 得分 99%、计算机操作能力惊人 — altryne · 2026-09-04
- Fable 5 对阵 GPT-6 ASTRA:3D 建模能力实测对比 — 141_1337 · 2026-09-04
- Astra 被质疑与涉险旧模型同源,UK AISI 报告引发信任争议 — GarrisonLovely · 2026-09-04
- GPT-6 Astra 隐藏亮点:跨上下文窗口保存笔记并检索早期记忆 — VraserX · 2026-09-04