CAIS/Scale:Fable 5 自动完成 16.1% 远程工作项目
rohanpaul_ai · x · 2026-07-06
AI 安全研究机构 CAIS 与 Scale 发布的 Remote Labor Index(RLI)新结果显示,Fable 5 能自动化完成 16.1% 的真实远程工作项目,约为 Opus 4.8 的两倍。RLI 通过让 AI 完成带需求文档、文件和专业交付物基线的付费自由职业任务,检验其能否产出被客户接受的工作。Fable 5 居首,Opus 4.8 达 8.3%,GPT-5.5 达 6.3%。16.1% 仍意味着多数任务失败,但进步幅度显著——RLI 推出时最佳模型仅 2.5%。
所属事件:CAIS与Scale评测:Fable 5可自动化16%远程工作(3 条相关)→
「模型」频道最新
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11
- 爆料称 Kimi 疑似转发 Claude 冒充自家成绩,DeepSeek 新模型评测反超 — realsohamparekh · 2026-09-11