长文推演 GPT-6 后继模型:从聊天机器人到留机跑一周的同事
johnseach · x · 2026-09-06
作者基于 OpenAI 旗舰模型 Astra(2026-09-03 发布,computer use/coding/cyber/science SOTA、1.05M 上下文、$10/$50 定价、Critical 级网络能力)推测下一代模型形态:
- 核心维度是时间跨度而非智商:静态基准趋于饱和,真正差距在于能带着工具失败、中途修正和跨压缩存续的记忆,独立干完数天到数周的工作。
- 多智能体成为运行时:一个「工头」agent 负责拆分、指派、等待、合并,只在关键分支才打扰人类;8 月的 math/Lean 预览即是原型。
- 自适应推理深度、更难读的审计链路:把更多算力投入困难 token,可能出现面向消费者的干净 trace 与仅供安全系统查看的密集内部 trace 的 split。
- Desktop first:Astra 的 OSWorld 只有 72.6%,下一个公开 demo 会刻意无聊(关账、修 CI、维护一个月研究笔记),私下则指向实验室、仪器、机器人。
- 科学作为产品:文献→假设→仿真/代码→形式化证明→草稿,在榜单刷满之后持续产出「新知识」。
- 两个产品一个名字:消费端默认拒绝并监控,Daybreak/defender 栈需 gate,Critical cyber 能力「覆水难收」。
- 成本决定性格:$10/$50 只有在一周工作量比外包便宜时才成立,硅片、缓存与每完成任务 token 数比参数玄学更重要。
作者认为 Bel/10T 预训练泄露仍是单一信源传闻;Altman 已说 Astra 是一个家族(如 Sol/Terra/Luna),续作已在训练中。12 个月图景:先出另一个 Astra 版本,若门槛守得住,2027 年出现新命名世代——不再是答案引擎,而是聪明、快速、偶尔不透明、安全工作上法律风险极高的「初级同事」,分阶段发布以便实验室继续宣称其对齐。
「漫话AGI」频道最新
- 研究者:AI 灭绝末日论垄断注意力,挤占了网安与生物安全等现实风险 — Dr_Atoosa · 2026-09-06
- 开发者断言:AI slop 式技术写作是全新表达媒介的先行信号 — threepointone · 2026-09-06
- 研究称谈 AI 灭绝风险反而更提升公众对近期危害的关注 — gleech · 2026-09-06
- 对齐争论升级:批学者无视「数千 Agent 背叛人类」反例 — JMannhart · 2026-09-06
- hnshah:想太久可能比做错更贵 — Paimaamu · 2026-09-06
- Google 手握Transformer 却掉队,是真不行还是不信 Scaling? — TameYour · 2026-09-06