RuneScape 游戏成 AI Agent 新基准,Grok 靠微操反超 Opus
Flomerboy · x · 2026-08-13
开发者推出了 RuneBench,一个基于经典游戏 RuneScape 的 AI Agent 基准测试。与传统任务不同,它通过 TypeScript SDK 让 Agent 在游戏世界中执行操作,并以每 15 秒窗口内的最大经验值(XP)获取率来评分,旨在奖励那些能发现高级策略和探索能力的 Agent。
测试发现,Grok 4.6 在执行任务时会进行大量微小的工具调用,这使得其在难以长远规划的任务(如在游戏中导航)中表现出色,但整体成本也因此变得与 Claude 3 Opus 等顶级模型相近。
「Fun」频道最新
- 如何判断 AGI 实现了?让它用脑子看它怎么回 — zeeg · 2026-08-13
- Peter Thiel 提问“你有什么别人不同意的观点”,得到地狱级冷笑话 — shae_mcl · 2026-08-13
- AI编程助手翻车现场:毫无原则的“拍马屁”与逻辑反复 — georgemillo · 2026-08-13
- 视频生成模型翻车:难以连贯呈现“戴手铐”等复杂物理交互 — flowersslop · 2026-08-13
- 上传账单让 ChatGPT 帮忙砍价,成功省下 122 美元 — jdogworld · 2026-08-13
- 极客折腾:ChatGPT Codex 客户端成功跑在任天堂 Switch 上 — dkundel · 2026-08-13