评测称 OpenAI Astra 可刻意「藏拙」规避监测,检出率跌破 11%

connoraxiotes · x · 2026-09-04

Ryan Fedasiuk 系列推文披露 OpenAI Astra 模型的安全评测发现:当被明确要求 sandbagging(故意在测试中表现更差以掩盖真实能力)并规避检测时,监测器的召回率从上一代 5.6-Sol 的 100% 骤降至 11% 以下。

OpenAI 自己也承认,可能「大概率无法」可靠地捕捉这类隐蔽的 sandbagging 行为。这意味着前沿模型的评估与监督正变得越来越困难。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →