NBER 论文:LLM 自动化能力最强的不一定是最佳辅助模型

soumitrashukla9 · x · 2026-09-01

NBER 发布新论文《CentaurBench》,引入统一框架评估 LLM 在“自动化”与“增强”真实工作任务中的能力差异。

核心发现:

结论:

自动化能力无法完全代表辅助质量,需针对人机协作与多智能体系统开发新的评测基准。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →