研究显示最准确的模型并不总是用户最偏好的

soumitrashukla9 · x · 2026-08-27

转推了 Mina Lee 领导的一项研究,该研究发现模型在自动化任务中的准确率并不总是与其作为辅助工具时的用户偏好成正比。

例如,Opus 和 Sonnet 在独立执行任务方面表现强劲,但在提供辅助方面表现一般;而 GPT-5-Mini(注:原文可能指代特定模型或笔误)在这两个维度都表现良好。Gemini 模型作为助手的表现优于作为自动化执行者的表现。

所属事件:伯克利 CentaurBench:最强模型未必是最好助手(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →