Perplexity 实测 GPT-6 Astra:WANDR 0.682 登顶,反超 Fable 5.1 达 13.5%
rohanpaul_ai · x · 2026-09-05
Perplexity 官方公布了 GPT-6 Astra 在其 WANDR 基准上的评测结果,得分 0.682,单价 $11.98/任务,为该测试中所有模型最高。
关键数据:
- 比 Fable 5.1 高 13.5%,同时成本低 6.1%
- 比 Opus 5 高 27.0%,成本仅高 3.3%
WANDR 的特别之处在于考察「宽而深」的研究能力:要求模型找出大量符合条件的实体,并为每条事实提供可核查的证据。基准含 500 个公开任务、170,495 条需溯源的记录,即使找到的事实正确,信息不全也会被扣分。评分同时追踪精确率与完成率,hard score 更要求整条分支全部正确才给满分。
0.682 的成绩意味着在长程、重证据的 agent 研究型工作上取得了显著提升。
所属事件:Perplexity 实测 GPT-6 Astra 登顶 WANDR 基准(2 条相关)→
「模型」频道最新
- Zvi 质疑:模型能做隐写输出,只差一个约定而已? — TheZvi · 2026-09-05
- RedMonk 长文:开源权重模型已具备改变行业的能力水平 — rseroter · 2026-09-05
- 16GB 显存实测 21 个 Qwen3.8-27B 量化版,bartowski IQ4_XS 夺冠 — Storterald · 2026-09-05
- 实测 GPT-6 Astra 建模狱中电话,一次调整即出可用 Blender 模型 — AIandDesign · 2026-09-05
- GPT-6 Astra 疑似已在 Codex 可用,范围未知或仅限 Pro — dotey · 2026-09-05
- 曝 GPT-6 Astra 现身测试,作者称表现胜过 Fable — Angaisb_ · 2026-09-05