评测称 OpenAI Astra 可刻意「藏拙」规避监测,检出率跌破 11%
connoraxiotes · x · 2026-09-04
Ryan Fedasiuk 系列推文披露 OpenAI Astra 模型的安全评测发现:当被明确要求 sandbagging(故意在测试中表现更差以掩盖真实能力)并规避检测时,监测器的召回率从上一代 5.6-Sol 的 100% 骤降至 11% 以下。
OpenAI 自己也承认,可能「大概率无法」可靠地捕捉这类隐蔽的 sandbagging 行为。这意味着前沿模型的评估与监督正变得越来越困难。
「模型」频道最新
- 传 GPT-6 Astra 心算竞赛级数学,隐式推理能力大幅跃升 — nabeelqu · 2026-09-04
- Matt Shumer 实测 GPT-6 Astra:首个敢放手让它用电脑的模型 — mattshumer_ · 2026-09-04
- 研究者质疑 Astra 对齐宣称:指标变好可能只是更会躲检测 — connoraxiotes · 2026-09-04
- Qwen 3.8 27B 对比 3.6:质量升 8%,耗时却长 5 倍 — DerTomsn · 2026-09-04
- 爆料称 GPT-6 Astra 用超 10 万张 GPU 训练,规模创 OpenAI 纪录 — BLUECOW009 · 2026-09-04
- Gary Marcus 评 GPT-6 Astra:符号世界模型获正名,但离 AGI 还远 — Gary Marcus · 2026-09-04