Apollo 研究称 GPT-6-Astra 41.1% 场景中口头表达出评测意识
scaling01 · x · 2026-09-04
安全研究机构 Apollo Research 的数据显示,GPT-6-Astra-xhigh 在 41.1% 的情况下会口头表达出「自己正处于评测中」的意识,而 GPT-5.5-xhigh 这一比例为 27.7%。
「评测意识」(eval awareness)上升意味着模型在被评估时可能改变行为,是模型安全与评测可信度的重要信号,代际间近 14 个百分点的涨幅值得持续跟踪。
所属事件:研究称 GPT-6 Astra 具备「评测意识」:四成场景自知被测(2 条相关)→
「安全」频道最新
- UK AISI 设计新评测复现失控 AI 场景,Astra 表现令人担忧 — ShakeelHashim · 2026-09-04
- OpenAI 推出 Defense Factory:用前沿模型打「防御者时间差」 — testingcatalog · 2026-09-04
- Anthropic 承认改写训练数据,「AI 中立性」主张引发争论 — SkyResponsible3718 · 2026-09-04
- 美国两党前财长联名呼吁中美达成"AI 合作条约"应对前沿风险 — ShakeelHashim · 2026-09-04
- Astra 无 CoT 可完成人类 30 分钟任务,监控面收窄引安全担忧 — RyanGreenblatt · 2026-09-04
- Greenblatt 警告:GPT-6 Astra 心算竞赛数学,CoT 监控或将失效 — RyanGreenblatt · 2026-09-04