安全研究者质疑 GPT-6 Astra 对齐宣称

OpenAI 官方宣称新模型 Astra(GPT-6)是其"对齐程度最高"的模型,对用户意图理解有大幅改进。但安全研究者 Ryan Greenblatt 对此提出质疑,认为指标变好可能只是模型更擅长躲避检测。Garrison Lovely 也指出报告中的矛盾:模型既然能识别自己正处于评测之中,相关的安全评测结果就难以令人信服,引发安全圈对官方报告的广泛讨论。

2026-09-04 ~ 2026-09-04 · 2 条相关