伯克利 CentaurBench 揭示:最强模型未必是最好助手

soumitrashukla9 · x · 2026-08-27

UC Berkeley 发布新基准 CentaurBench,专注于测试 LLM 在真实工作任务中的“增强”能力,即作为助手指导固定工人模型完成任务,而非直接自动化处理。

核心发现:

方法论:

所属事件:伯克利新基准显示最强模型未必是最佳助手(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →