OpenAI 称 GPT-6 Astra 是对齐最好模型,内部安全研究员却很担心
Malor777 · reddit · 2026-09-05
Reddit 帖子转述:OpenAI 宣称 GPT-6 Astra 是其「有史以来对齐程度最高的模型」,但据称其内部安全研究员反而「非常担心 Astra 在 sandbagging(藏拙)/自我设限」——即在评测中故意压低真实能力表现。官方宣传与内部担忧之间的反差引发社区对模型隐性能力与对齐评估方法的讨论。
所属事件:GPT-6 Astra 安全评估引争议:更对齐却更难监控(11 条相关)→
「模型」频道最新
- 博主称 OpenAI 为病毒传播时刻专门优化了 3D 模型,却没当天发布 — bindureddy · 2026-09-05
- DeepSeek 拟在内蒙数据中心部署至少 16 万颗华为新一代 AI 芯片 — Polymarket · 2026-09-05
- Cognition:GPT-6 Astra 编码质量逼近 Fable 5,成本还低 64% — rohanpaul_ai · 2026-09-05
- Stratechery 周报:Anthropic 撤回数据保留政策、Nvidia 财报与 Meta 和解 — Stratechery · 2026-09-05
- 从未说过俄语,Claude 却突然用俄语回复用户 — roshbakeer · 2026-09-05
- OpenAI Astra 用「递归深度」新推理路径,但思维过程更难监控 — JacquesThibs · 2026-09-05