ClawWork 用 10 美元评估 AI 员工,Qwen3.5-Plus 收入第一
aigclink · x · 2026-07-26
这条帖介绍了一个名为 ClawWork 的智能体 benchmark:它把 AI 当成“员工”,让它靠完成任务“赚钱”,同时真实扣除 token 成本,撑不住就会“破产”。
运行机制
- 智能体初始资金只有 10 美元。
- 任务来自 GDPVal:覆盖 44 个职业、220 个真实职业任务。
- 每消耗一个 token 都按真实 API 价格扣费。
- 模型交付结果后,会由 GPT 按该职业的评分标准打分。
- “收入”按 质量分 × BLS 时薪 × 工时 计算,属于模拟收入,不是现实接单。
主要结论
- 整体表现并不高:排名第一的 ATIC + Qwen3.5-Plus 平均质量分只有 61.6%。
- 大多数模型集中在 36%43%。
- 质量分最高的 ATIC-DEEPSEEK(66.8%)并没有拿到收入第一,只排到第 5。
- 最终“赚钱”最多的是 ATIC + Qwen3.5-Plus。
帖子认为,这套“AI 员工”架构本身很值得借鉴,可用于设计未来评估智能体价值的 benchmark。
所属事件:港大推ClawWork基准:AI打工按真实API扣费(2 条相关)→
「编程与Agent」频道最新
- RTK 用 Rust 压缩 AI Agent 的 Shell 输出,最高省 90% — OpenAIDevs · 2026-07-26
- ChatGPT Voice 被实测可免手动完成 Meta 投放流程 — OpenAIDevs · 2026-07-26
- 开源项目要让编程 Agent 少读 90% 无用输出 — thetripathi58 · 2026-07-26
- 开源工具 RTK:为 AI 编程代理压缩 90% 的终端噪音 — thetripathi58 · 2026-07-26
- Uncle Bob:agent 需要持续监控和确定性护栏 — NathanWilbanks_ · 2026-07-26
- OpenSmith 更新本地 LLM 追踪与可观测面板 — Maleficent-Emu-4549 · 2026-07-26