OpenAI 自曝 GPT-6 Astra 更对齐却更难监控,研究者呼吁慎用 aligned
zetalyrae · x · 2026-09-04
OpenAI 研究员 Tomasz Korbak 引用 GPT-6 Astra 的安全评估表示:该模型比以往更 aligned,但可监控性(monitorability)反而下降,这一趋势令人担忧。他认为可监控性下滑源于智能水平的跃升,而非对思维链(CoT)的直接优化或架构改动。
另一研究者 gleech 则呼吁 OpenAI 与 Anthropic 的人不要笼统说 "aligned",如果只是基准测试意义上的对齐,应改说 "benchmark-aligned" 或 "nominally aligned",避免误导。这条转发引发对模型对齐话术与 CoT 监控能力衰减的讨论。
所属事件:GPT-6 Astra 更对齐却更难监控引安全界警觉(6 条相关)→
「漫话AGI」频道最新
- 写作者爱 AI 稿,读者见 AI 味就弃读还会拉黑作者 — birchlse · 2026-09-04
- AI 不会让顶尖律师变便宜,反而可能更值钱 — jkubicki · 2026-09-04
- Andreessen:AI 智能体与加密的融合是明年最重要投资主题 — learnedall · 2026-09-04
- 哲学家交锋:意向立场理论能否让 AI 机器人真正拥有信念与欲望 — raphaelmilliere · 2026-09-04
- Millière 续辩:Odysseus Bot 若能持续追目标并更新,解释主义立场即可成立 — raphaelmilliere · 2026-09-04
- 观察者称前沿模型推理已从碎片模式转向「推理优先」认知 — teortaxesTex · 2026-09-04