Astra 无思维链推理暴涨引安全担忧

Neel Nanda 复现了 AISI(AI Security Institute)对 Astra 系统卡的评测宣称,确认该模型在无思维链(no-CoT)条件下推理能力出现不成比例的跃升;安全研究者 Jeff Ladish 随即对这种「隐蔽推理」能力表达安全担忧。当前结论是:提升高度集中于无 CoT 计算,疑似源于模型架构的特殊机制(很可能是循环模型),而非通用能力进步,这将削弱通过读取思维链来监控模型对齐的有效性。

已确认

尚未确认

为什么重要

2026-09-11 ~ 2026-09-11 · 7 条相关

事件全程(共 2 集)→

一手来源