ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18%
ysu_nlp · x · 2026-09-11
一条综合能力基准 ApprenticeBench 的结果引发讨论:它像真实工作一样综合考察计算机使用、带记忆笔记的持续学习、长程任务等,模型任何短板都会暴露。
- 闭源 Fable 5.1 得分 72%,每任务成本 $18.23;开源 Kimi K3 仅 18%,成本反而更高($25.83)。
- 前沿模型准确率已超过人类专业人士,但成本约为人类的 250%。
- 开源模型不一定更便宜:能力不足时会消耗大量 token,导致总成本反超。
该基准在不同模型间区分度很高,被认为揭示了大模型在真实知识工作上的真实差距。
「模型」频道最新
- 曝 DeepSeek 4.1 flash 也用超大 ngram 词嵌入,架构酷似 Qwen4 — ccerrato147 · 2026-09-11
- ValsAI 发布 RSI Index:首个第三方基准测试模型自研继任能力 — JenniferHli · 2026-09-11
- Assistant Benchmark 上线:61 款 AI 助手 15 个维度实测横评 — Scobleizer · 2026-09-11
- 实测者评 Devin 新模型:非最强但执行力强,$20 订阅超值 — brandon_galang · 2026-09-11
- Business Insider 问 ChatGPT、Gemini、Claude、Grok:AI 如何毁灭人类 — coinfanking · 2026-09-11
- 爆料称 Kimi 曾用 Claude 原始思维链蒸馏,网友讽其山寨 Claude — xuanalogue · 2026-09-11