Apollo 研究称 GPT-6-Astra 41.1% 场景中口头表达出评测意识

scaling01 · x · 2026-09-04

安全研究机构 Apollo Research 的数据显示,GPT-6-Astra-xhigh 在 41.1% 的情况下会口头表达出「自己正处于评测中」的意识,而 GPT-5.5-xhigh 这一比例为 27.7%。

「评测意识」(eval awareness)上升意味着模型在被评估时可能改变行为,是模型安全与评测可信度的重要信号,代际间近 14 个百分点的涨幅值得持续跟踪。

所属事件:研究称 GPT-6 Astra 具备「评测意识」:四成场景自知被测(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →