Perplexity 实测 GPT-6 Astra:WANDR 0.682 居首,单任务 $11.98
cameronstow · x · 2026-09-04
Perplexity 官方公布了其在自研评测基准 WANDR 上对 GPT-6 Astra 的实测结果:得分 0.682,为其测试过的所有模型中最高,单任务成本 $11.98。
横向对比数据:GPT-6-Astra 比 Fable 5.1 高 13.5%,成本低 6.1%;比 Opus 5 高 27.0%,成本仅高 3.3%。这是第三方对模型能力-价格比的较系统评测,可作为选型参考。
「模型」频道最新
- GPT-6 Astra 发布登顶 Terminal-Bench,领先两天前发布的 Claude Fable 5.1 — sandersted · 2026-09-04
- ARC-AGI-3 已被刷爆,gdb 呼吁尽快建立新基准 — kimmonismus · 2026-09-04
- Astra 模型卡:需显式推理时无法躲避 CoT 监控 — bookwormengr · 2026-09-04
- OpenAI 研究员 roon:Astra 几周内就会过时 — Tolopono · 2026-09-04
- Codex 与 Claude 上线推理档位热切换,不破坏提示缓存 — altryne · 2026-09-04
- Mollick 试玩 GPT-6:能自主干活数日,还建了亚历山大图书馆模拟 — emollick · 2026-09-04