Perplexity 实测 GPT-6 Astra:WANDR 0.682 登顶,反超 Fable 5.1 达 13.5%

rohanpaul_ai · x · 2026-09-05

Perplexity 官方公布了 GPT-6 Astra 在其 WANDR 基准上的评测结果,得分 0.682,单价 $11.98/任务,为该测试中所有模型最高。

关键数据:

WANDR 的特别之处在于考察「宽而深」的研究能力:要求模型找出大量符合条件的实体,并为每条事实提供可核查的证据。基准含 500 个公开任务、170,495 条需溯源的记录,即使找到的事实正确,信息不全也会被扣分。评分同时追踪精确率与完成率,hard score 更要求整条分支全部正确才给满分。

0.682 的成绩意味着在长程、重证据的 agent 研究型工作上取得了显著提升。

所属事件:Perplexity 实测 GPT-6 Astra 登顶 WANDR 基准(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →