GPT-6 Astra 号称可删脚手架,但控制层脚手架一个不能少

Slight_Republic_4242 · reddit · 2026-09-15

OpenAI 发布 GPT-6 Astra,核心卖点是长时程 proactive agent 任务(5 小时以上)通过率提升 20% 且推理调用更少——官方称「模型决策力提升让我们可以移除脚手架」。能力侧数据亮眼:Terminal-Bench 4.0 得分 57.9%(GPT-5.6 Sol 为 37.3%),computer use 快到能以约 4 倍速度完成金融建模世界杯人类冠军水平的任务。

但作者指出安全章节的问题:所有安全数据都是相对值——「意外后果」比 GPT-5.6 Sol 少 89%、比 Claude Fable 5.1 少 74.7%——却从未给出绝对发生率,而对「误删数据」这类故障,每千次运行的发生率才是关键数字。

更矛盾的是:Astra 是首个在 OpenAI 自己 Preparedness Framework 下达到 Critical 网络安全能力阈值的模型,且企业版发布时默认关闭,配套网站/桌面应用白名单、重大操作确认、未授权工具调用自动审计等管控。作者的核心论点:能力脚手架(重试、步骤校验)是为弱模型准备的,可以删;控制脚手架(授权边界、确认门、审计日志)是为能行动的模型准备的,模型越强越不能删。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →