ApprenticeBench 揭真实工作差距:闭源 72% vs 开源 Kimi K3 仅 18%

ysu_nlp · x · 2026-09-11

一条综合能力基准 ApprenticeBench 的结果引发讨论:它像真实工作一样综合考察计算机使用、带记忆笔记的持续学习、长程任务等,模型任何短板都会暴露。

该基准在不同模型间区分度很高,被认为揭示了大模型在真实知识工作上的真实差距。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →