NBER 论文:LLM 自动化能力最强的不一定是最佳辅助模型
soumitrashukla9 · x · 2026-09-01
NBER 发布新论文《CentaurBench》,引入统一框架评估 LLM 在“自动化”与“增强”真实工作任务中的能力差异。
核心发现:
- 在 7 项经济相关的真实任务中,模型在两种模式下的排名仅适度相关。
- 自动化模式下的优胜者,在 5 项任务中输掉了增强模式比拼。
- 辅助效果并非总是正向:在 3 项任务中,无辅助的弱模型表现超过了所有有辅助的情况;仅有一个模型的指导平均优于无指导。
结论:
自动化能力无法完全代表辅助质量,需针对人机协作与多智能体系统开发新的评测基准。
「研究」频道最新
- 1955 年 AI 提案与 2026 现状对比 — dejanseo · 2026-09-01
- 相对 Fisher 信息与大模型自然梯度法 — FrnkNlsn · 2026-09-01
- 新论文探讨生成式 AI 中专业伦理与通用伦理的冲突 — mircomusolesi · 2026-09-01
- 开发者如何界定 AI 软件开发系统:Agent 还是闭环? — lovettsendit · 2026-09-01
- DeepMind将前沿评测放入加密环境以防模型“备考” — VraserX · 2026-09-01
- 谷歌开源模型数天处理坦桑尼亚1100万张动物照片 — anselm · 2026-09-01