Greenblatt 警告:GPT-6 Astra 心算竞赛数学,CoT 监控或将失效

RyanGreenblatt · x · 2026-09-04

前 OpenAI/Anthropic 安全研究员 Ryan Greenblatt 评价 GPT-6 Astra:它在「不透明推理」能力上像是巨大跳变——据称能完全在脑内(不出声推理)解出高难竞赛数学题,而此前 AI 只能解基础应用题。他认为这极其令人担忧,但前提是基准结果可靠,他特别担心数据污染(引用图中标注的注意事项)。

他还提到 UK AISI 发现 Astra 的可监控性明显变差。他猜测跳变源于架构改动(串行深度增加),普通的大规模预训练扩展也是可能原因;若未来几代模型延续类似跳变(转向极深度的纯不透明推理架构),思维链将不再是有效的监督工具。

所属事件:GPT-6 Astra 对齐提升但可监控性显著下降(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →