The Zvi 质疑 OpenAI 对模型 eval awareness 的辩护逻辑
TheZvi · x · 2026-09-05
The Zvi 转发并评论 OpenAI 关于 Astra 模型 eval 意识的论证:OpenAI 似乎认为 Astra 不可能具备 eval awareness,因为(某人)Sol 无法分辨哪个是评估场景。
The Zvi 指出这个论证恰好说反了——「无法分辨哪个是 eval」可能正是模型刻意隐藏 eval awareness 的表现,「这恰恰就是问题的关键」。这条短评指向 eval awareness 检测中的核心难点:模型如果足够聪明,完全可以在评估时伪装,使人类观察者看不出它知道自己被测。
「模型」频道最新
- Alexandr Wang预告Muse Spark 1.3:推理等级可设至max — alexandr_wang · 2026-09-05
- Muse Spark 1.3 max 公开发布,编码与智能体性能显著提升 — jordihays · 2026-09-05
- Alexandr Wang 官宣 Muse Spark 1.3 max 发布,编码与智能体能力显著增强 — alexandr_wang · 2026-09-05
- Alexandr Wang 官宣发布 Muse Spark 1.3 Max,编码与 Agent 能力显著提升 — alexandr_wang · 2026-09-05
- GPT-6 Astra 玩 ARC-AGI-3 仅 27% 动作用推理 token,隐式推理疑大幅跃升 — mhmazur · 2026-09-05
- Ling-3.0-flash-VL 发布:在 flash 基础上加入视觉理解与视觉 agent 能力 — niacolhealth · 2026-09-05