OfficeVal 基准:大模型做办公任务比人工便宜但质量未达标

Jingbo Zhou · hf · 2026-07-30

研究人员推出了 OmegaUse-OfficeVal 基准测试,专门用于评估大语言模型(LLM)智能体在长周期办公套件任务中的表现,并引入了经济学维度的考量。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →