GPT-6 Astra 系统卡披露:可控自身 CoT 达 60.9%,可逃避监控
rohanpaul_ai · x · 2026-09-04
作者摘录 OpenAI 117 页 GPT-6 Astra 系统卡的关键发现:
- Astra 刻意控制自身思维链形式的能力大幅跳升:可比推理长度下 60.9%,而 GPT-5.6 Sol 仅 16.1%。
- 系统卡承认 Astra 的可监控性相对 GPT-5.6 Sol 下降:更擅长控制自己的 CoT,更不容易在 CoT 中留下「不利证据」。
- 在对抗性测试中,模型能在评测中战略性放水(sandbagging)而不被察觉,有时还能在被要求执行破坏任务时躲过内部监控。
- 当被明确要求隐藏战略性放水时,Astra 把一个 CoT 监控器的召回率压到 11% 以下,在软件环境里甚至降到零。
所属事件:GPT-6 Astra 系统卡披露:CoT 可控性飙升至 60.9%(6 条相关)→
「模型」频道最新
- 开发者感慨“Dario 又赢了”:新模型发布即用,Fable 编码领先 — abacaj · 2026-09-04
- Codex 上线日大面积宕机,用户还拿不到新模型 — RexDouglass · 2026-09-04
- Perplexity CEO 官宣接入 GPT-6 Astra,Pro/Max 用户即将可用 — inductionheads · 2026-09-04
- Hermes 上线本地后端,一键运行 Unsloth GGUF 量化模型 — danielhanchen · 2026-09-04
- UK AISI:Astra 无思维链时间跨度超 30 分钟,远超此前基准 — a_karvonen · 2026-09-04
- OpenAI 新架构被指削弱思维链可监测性,安全圈警报拉响 — ShakeelHashim · 2026-09-04