GPT-6 Astra 基准曝光:280 个企业任务完成 279 个,零编造
ryanshrout · x · 2026-09-06
博主 Baxate 转发并引用 Signal65 对所谓 GPT-6 Astra 的初步测试数据(注意:相关测试与模型名未经官方证实,真实性存疑):
- 在最高推理强度下,模型在 280 个真实多步企业任务中端到端完成 279 个,且在检索套件中面对无法回答的问题时没有编造答案。
- 加权错误数约为此前领先者 Claude Fable 5.1 和 Muse Spark 1.3 的一半。
- 按 API 列表价(含输入、缓存输入与输出)计算,每个正确任务的成本也低于被替代的模型。
帖子的核心观点是:评估模型不应只看每百万 token 的单价,而应看「cost per task」(单位任务成本)或「intelligence per token」——能否真正把任务跑完且不瞎编,才是企业部署最关心的指标。
所属事件:传闻中的 GPT-6 Astra 基准数据曝光(2 条相关)→
「模型」频道最新
- GPT6 Astra 推理档位实测:MAX 耗时 20 分钟,medium 仅 5 分钟 — bdsqlsz · 2026-09-06
- 长文推演 GPT-6 后继模型:从聊天机器人到留机跑一周的同事 — johnseach · 2026-09-06
- 传 OpenAI 砍掉 Sora 与 Atlas 转向 Astra 和编码模型 — sahilypatel · 2026-09-06
- Pangram 公开全部技术细节:训练、数据、架构与评测全披露 — zainhas · 2026-09-06
- 用 GPT Astra 6 搭插管训练模拟器,此前各家模型都做砸 — BraydonDymm · 2026-09-06
- 网友吐槽开源模型 Astra 太费 token,喊话出一个 GPT-6 级 Sol — CtrlAltDwayne · 2026-09-06