Astra 无 CoT 推理大幅领先,隐蔽推理能力引发安全担忧
JeffLadish · x · 2026-09-11
Jeff Ladish 引用评测数据指出,Astra 在无思维链(no-CoT)推理任务上的胜算比次优模型(Fable 5.1)高 8.6 倍,单个前向传播可完成 7.2 步串行算术(次优为 4.1)。
他解释了为何这值得警惕:CoT 之所以是监控模型的有效手段,是因为前向传播内的串行计算深度受限,模型不得不把推理「写在明处」;无 CoT 推理能力越强,模型可进行的隐蔽推理就越多,CoT 的可监控性压力随之下降。Neel Nanda 用自己的私有 benchmark 复现了 AI 安全研究所的发现,印证 Astra 更难被监控。
所属事件:Astra 无思维链推理暴涨引安全担忧(7 条相关)→
「模型」频道最新
- GPT-6 Astra 首次尝试即驱动机器人臂,Ken Goldberg 点赞 Agentic Robotics — zhaoran_wang · 2026-09-11
- OpenAI 内部模型被称已证明 Navier-Stokes 千禧年难题 — QuintinPope5 · 2026-09-11
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- Astra 太能打:OpenAI 暂停 $200 ChatGPT Pro 新订阅,算力不够用了 — 机器之心 · 2026-09-11