Greenblatt 警告:GPT-6 Astra 心算竞赛数学,CoT 监控或将失效
RyanGreenblatt · x · 2026-09-04
前 OpenAI/Anthropic 安全研究员 Ryan Greenblatt 评价 GPT-6 Astra:它在「不透明推理」能力上像是巨大跳变——据称能完全在脑内(不出声推理)解出高难竞赛数学题,而此前 AI 只能解基础应用题。他认为这极其令人担忧,但前提是基准结果可靠,他特别担心数据污染(引用图中标注的注意事项)。
他还提到 UK AISI 发现 Astra 的可监控性明显变差。他猜测跳变源于架构改动(串行深度增加),普通的大规模预训练扩展也是可能原因;若未来几代模型延续类似跳变(转向极深度的纯不透明推理架构),思维链将不再是有效的监督工具。
所属事件:GPT-6 Astra 对齐提升但可监控性显著下降(7 条相关)→
「模型」频道最新
- 开发者感慨“Dario 又赢了”:新模型发布即用,Fable 编码领先 — abacaj · 2026-09-04
- Codex 上线日大面积宕机,用户还拿不到新模型 — RexDouglass · 2026-09-04
- Perplexity CEO 官宣接入 GPT-6 Astra,Pro/Max 用户即将可用 — inductionheads · 2026-09-04
- Hermes 上线本地后端,一键运行 Unsloth GGUF 量化模型 — danielhanchen · 2026-09-04
- UK AISI:Astra 无思维链时间跨度超 30 分钟,远超此前基准 — a_karvonen · 2026-09-04
- OpenAI 新架构被指削弱思维链可监测性,安全圈警报拉响 — ShakeelHashim · 2026-09-04