GPT-6 Astra 更对齐但更难监控:OpenAI 安全报告遭实质性质疑

sjgadler · x · 2026-09-04

sjgadler 转发 tylertracy321 对 OpenAI GPT-6 Astra 安全报告的分析,并引用 OpenAI 研究员 tomekkorbak 的表态:Astra 比以往模型更对齐,但可监控性下降,OpenAI 认为这是智能跃升所致、并非对 CoT 或架构的直接优化压力,公司对此趋势非常重视。

tylertracy321 的核心论点:

所属事件:GPT-6 Astra 发布:能力跃升伴随评测争议与可监控性下降(62 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →