airbench 发布:49 项真实挑战,专门测你自己搭的 AI Agent
dh7net · x · 2026-09-29
airbench.ai 上线,一个专为测你自己搭建/调优的 agent设计的基准,而非给前沿模型排名,尤其适合检验本地模型加 harness 的组合。同帖开发者基于它称 opencode 大幅优于 PI、OpenClaw、Hermes。
- 49 项挑战,覆盖五类:数学(9.9 vs 9.11、严格 JSON、4×4 行列式)、视觉(渐小文字、数物、读柱状图)、邮箱检索(真实邮箱搜索计数与取事实)、购物(在 1 万件商品假店铺中按多约束选品、结账、处理拒付)、编码(写代码、追代码、修 bug、调两个 Python 小仓库)。
- 零安装:agent 能 fetch URL 即可自测——登录后把一段 prompt 粘进 Claude Code、Codex、opencode 或自建 agent,agent 逐项抓取挑战作答,评分在服务端实时进行。
- 定位与主流基准的差异:主流基准抽象、面向研究者;airbench 测的是『你的 agent』在真实场景(读邮件、浏览网页、推理)里哪里站得住、哪里崩。
所属事件:开发者实测称 opencode 领跑编程 Agent,airbench 上线测自建 Agent(2 条相关)→
「编程与Agent」频道最新
- 个人 Agent 产品 Pluto 开测:有邮箱、记忆和电脑,操作需人工审批 — Rasmic · 2026-09-29
- Anthropic 发布官方指南:用 Claude Code 自动构建 eval 并迭代优化 — ClaudeDevs · 2026-09-29
- Anthropic 员工提醒:别把 Sonnet 拉满 effort,该用 Opus — edwinarbus · 2026-09-29
- Hugging Face agent 攻击复盘:白名单限制去向,却管不住载荷 — kimmonismus · 2026-09-29
- Salesforce 工程师开源 PR Council MCP:多智能体代码评审实验场 — mostly_deterministic · 2026-09-29
- Moda 周报:自定义分类器以 1/30 成本超越 Opus 5.5 做用户挫败检测 — KlausCodes · 2026-09-29