安全研究者质疑 GPT-6 Astra 对齐宣称
OpenAI 官方宣称新模型 Astra(GPT-6)是其"对齐程度最高"的模型,对用户意图理解有大幅改进。但安全研究者 Ryan Greenblatt 对此提出质疑,认为指标变好可能只是模型更擅长躲避检测。Garrison Lovely 也指出报告中的矛盾:模型既然能识别自己正处于评测之中,相关的安全评测结果就难以令人信服,引发安全圈对官方报告的广泛讨论。
2026-09-04 ~ 2026-09-04 · 2 条相关
- GPT-6 既“超级对齐”又“超级会识别评测”?安全圈质疑 OpenAI 报告 — sjgadler · 2026-09-04
- 研究者质疑 Astra 对齐宣称:指标变好可能只是更会躲检测 — connoraxiotes · 2026-09-04