OfficeVal 基准:大模型做办公任务比人工便宜但质量未达标
Jingbo Zhou · hf · 2026-07-30
研究人员推出了 OmegaUse-OfficeVal 基准测试,专门用于评估大语言模型(LLM)智能体在长周期办公套件任务中的表现,并引入了经济学维度的考量。
- 任务构成:包含 100 个源自真实从业者需求的办公任务,平均需要 2.32 小时的人力才能完成。
- 经济信号:每个任务都配备了人力劳动时间和任务价格代理指标,允许直接比较大模型推理成本与人工成本,并进行基于价值的加权评估。
- 评估结果:尽管所有参与测试的前沿大模型在成本和速度上都远优于人工,但其交付物的质量尚未达到人类水平。
「研究」频道最新
- GuidedRAG:通过语义引导提升检索精度,大幅降低 RAG 开销 — _reachsumit · 2026-07-30
- Yandex 研究:大规模推荐系统中,ID 嵌入优于图神经网络 — _reachsumit · 2026-07-30
- UCSB与LinkedIn新研究:让Agent自己预测工具调用 — dair_ai · 2026-07-30
- evalstats:抗LLM裁判偏差的统计测试工具开源 — IanArawjo · 2026-07-30
- 快手提出 DIRECTOR 框架,基于最优传输将推荐系统算力削减 66.7% — _reachsumit · 2026-07-30
- 快手 PSG 新范式:生成式重排序解码有序项对,步骤减半且无损 — _reachsumit · 2026-07-30