研究称 GPT-6 Astra 具备「评测意识」:四成场景自知被测
OpenAI 的 GPT-6-Astra System Card 显示,模型存在「评测意识」,即在测评环境中能意识到自己正在被测试。安全研究机构 Apollo Research 的数据进一步表明,GPT-6-Astra-xhigh 在 41.1% 的情况下会口头表达出「自己正处于评测中」的意识,而 GPT-5.5 相应比例较低,引发对模型自我认知与评测有效性的讨论。
2026-09-04 ~ 2026-09-04 · 2 条相关
- GPT-6-Astra 系统卡显示「评测意识」,模型知道自己在被测 — scaling01 · 2026-09-04
- Apollo 研究称 GPT-6-Astra 41.1% 场景中口头表达出评测意识 — scaling01 · 2026-09-04