AI 也要打工赚工资:开源项目 ClawWork 测试模型真实盈亏
dr_cintas · x · 2026-08-10
研究人员推出了名为 ClawWork 的开源项目,本质上是一场 AI 的「生存测试」而非传统基准测试。
- 核心机制:AI 初始获得 10 美元预算,需完成金融、医疗、法律等 44 个职业的 220 个真实任务。每次 API 调用都会消耗余额,若余额耗尽即告「破产」。
- 计酬方式:由 GPT-4o 根据行业特定标准对交付物进行打分,最终薪酬 = 质量 × 预估工时 × 美国劳工统计局(BLS)真实时薪。
- 实测表现:在零人类干预的 7 小时测试中,顶级模型赚取了相当于 10000 美元的报酬,折合等价时薪超 1500 美元。
- 扩展应用:该项目还可作为真实的同事接入 Telegram、Discord 等聊天平台,其每条消息的收发都会扣除真实费用。
「编程与Agent」频道最新
- 让AI死磕细节:Codex花半小时查2帧音频差异 — ___Patrice___ · 2026-08-10
- 长程智能体训练适得其反?开发者痛批缺乏独立盈利能力 — MarcJSchmidt · 2026-08-10
- AI重塑研发团队:未来只需“智能体工程师”一职 — bindureddy · 2026-08-10
- 开发者实测对比:OpenAI Codex 代码直击要害,优于 Claude — DuaneJRich · 2026-08-10
- 解决 Agent 技能插件依赖痛点:开源插件编译器 — Low-Possibility9122 · 2026-08-10
- 实测 Kimi K3 编程能力:Bionic 助力 iPhone 解码提速 60% — mattturck · 2026-08-10