新研究:最强模型不等于最佳辅助,自动化能力难预测协作效果

soumitrashukla9 · x · 2026-08-27

论文《CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks》提出新评估框架,对比 LLM 在“直接完成任务”与“辅助弱模型/人类”两种模式下的表现差异。

核心发现:

所属事件:伯克利新基准显示最强模型未必是最佳助手(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →