Signal65 实测称 GPT-6 Astra 完成 279/280 企业任务且零编造
ryanshrout · x · 2026-09-06
Ryan Shrout 转发 Signal65 PINNACLE 基准的首批结果,称 OpenAI GPT-6 Astra 在企业 agent 任务上表现惊人,但该模型与数据均未经官方证实,需保持怀疑:
- 在最大推理强度下,GPT-6 Astra 完成了 280 个真实多步企业任务中的 279 个,端到端跑完全程。
- 在检索套件中面对不可回答的问题时没有编造任何答案(fabricated nothing)。
- 加权错误数约为此前领先者 Claude Fable 5.1 和 Muse Spark 1.3 的一半。
- 按官方 API 列价计算,每个正确任务的成本也低于被替代的模型。
PINNACLE 的方法特点是:用美国劳工部的职业工作活动构建场景、运行时程序化生成沙盒与答案密钥(无固定语料可背)、由代码而非模型裁判确定性评分,每次运行都是真实 live agent 会话。以上内容来自第三方帖子,模型名称与结果可信度存疑,请视为未证实爆料。
「模型」频道最新
- 用户实测本地跑 gemma4:31b-mlx:体验与付费订阅难以区分 — walkingriver · 2026-09-06
- 开发者摸索 AI 写作:结果渐入佳境但 token 与上下文消耗巨大 — willcb · 2026-09-06
- 「以前模型刷分,现在反过来是 benchmark 在刷模型」 — abeirami · 2026-09-06
- GPT-6 Astra 一个提示词不到 10 分钟建出完整应用 — RileyRalmuto · 2026-09-06
- Zvi 谈 Astra「不作弊」:模型先想会被抓再收手,反而更糟 — ZeroStateReflex · 2026-09-06
- Astra 表现平平遭全网找补,楼主吐槽:评测标准双标现场 — Tim_Apple_938 · 2026-09-06