GPT-6 Astra 疑似可默算竞赛数学,可监控性大幅恶化引安全界担忧

MattGarciaEth · x · 2026-09-04

前 Anthropic 研究员 Ryan Greenblatt 引用基准结果称,GPT-6 Astra 在不透明推理能力上出现巨大跳跃:似乎能完全「在心里」解决高难度竞赛数学题,而此前模型只能解基础应用题。他强调若基准代表性成立将「极其令人担忧」,并特别担心数据污染等注意事项。

另一关键信号:UK AISI 发现 Astra 的可监控性(monitorability)明显变差。Greenblatt 猜测这一跳跃源于架构改动(串行深度增加),不过普通的大规模预训练扩容也是可能原因;若未来几代模型延续类似跳跃,内部推理将越来越难外部审查。

所属事件:GPT-6 Astra 更对齐却更难监控,安全界集中质疑(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →