Grok 4.5 在内部基准领先
billyuchenlin · x · 2026-07-11
Perplexity 的 Arav Srinivas 表示,他对 Grok 4.5 的表现印象很深。
被转述的信息包括:
- 在 Computer harness 中,Grok 4.5 在内部基准 WANDR 上拿到最高分;该基准衡量的是 agentic research 能力。
- 价格大约只有 Claude Opus 4.8 的一半。
- 在同等成本附近,它的表现还优于 Perplexity 当前的 GLM 5.2 post-trained 模型。
- Perplexity 已将 Grok 4.5 作为 Computer 中面向 Consumer Pro 和 Max 用户的 orchestrator 模型。
所属事件:Grok 4.5 接入 Perplexity 编排系统并登顶 WANDR 评测(10 条相关)→
「编程与Agent」频道最新
- 开发者发问:现在还该用 LangChain 还是自建 agent 框架? — curious_vii · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- 开发者误打误撞用 Fable 5.1 搭出一座「智能体工厂」 — 0xkarasy · 2026-09-03
- 微软新法:Foundry 智能体可经 Fabric IQ 调用 Fabric 数据智能体 — adnan_hashmi · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03
- doodlestein 沉淀数月经验,发布 Web 应用综合审查 Skill — doodlestein · 2026-09-03