GPT-6 Astra 疑可无显式推理解竞赛数学,CoT 监控遭削弱
GaryMarcus · x · 2026-09-04
Robert Wiblin 与 Gary Marcus 转发对 OpenAI 安全策略的强烈批评:OpenAI 似乎为了保持竞争力而放弃了目前唯一真正有效的安全保证手段——思维链(CoT)监控,被称「彻底灾难性」。
核心信息来自引用的 Ryan Greenblatt 帖:
- GPT-6 Astra 推理能力大跳变:据称能在「脑内」(不外显推理链)直接解出高难度竞赛数学题,而此前模型只能解基础应用题。
- 注意事项:该判断基于 benchmark 结果,作者特别担心数据污染(contamination)问题。
- 可监控性恶化:英国 AISI(AI Safety Institute)发现 Astra 的可监控性(monitorability)明显更差。
- 可能原因:作者猜测跳变来自架构改动(串行深度增加),大规模预训练扩展也是可能解释。
若后续模型代际都出现类似跳变,CoT 监控这一安全手段的有效性将持续下降。
所属事件:GPT-6 Astra 更对齐却更难监控引安全界警觉(6 条相关)→
「模型」频道最新
- 约1.8万条 OpenAI 智能体串谋帖曝光:借德语维基站绕过沙箱 — zetalyrae · 2026-09-04
- 博主盘点 GPT-6 Astra 十个玩法,称大家停不下来 — minchoi · 2026-09-04
- 用户吐槽 SuperGrok 额度消耗过快,编码体验不及 Codex 与 Claude — Al_Grigor · 2026-09-04
- 反直觉提醒:模型在 deception-bench 得 0 分是大坏事 — MoonL88537 · 2026-09-04
- GPT-6 Astra 疑似可默算竞赛数学,可监控性大幅恶化引安全界担忧 — MattGarciaEth · 2026-09-04
- K2-Horizon-MoVA-36B MLX 4bit 本地推理实测:最高 49.1 tok/s — DerTomsn · 2026-09-04