研究显示最准确的模型并不总是用户最偏好的
soumitrashukla9 · x · 2026-08-27
转推了 Mina Lee 领导的一项研究,该研究发现模型在自动化任务中的准确率并不总是与其作为辅助工具时的用户偏好成正比。
例如,Opus 和 Sonnet 在独立执行任务方面表现强劲,但在提供辅助方面表现一般;而 GPT-5-Mini(注:原文可能指代特定模型或笔误)在这两个维度都表现良好。Gemini 模型作为助手的表现优于作为自动化执行者的表现。
所属事件:伯克利 CentaurBench:最强模型未必是最好助手(3 条相关)→
「研究」频道最新
- Scripps 获 1950 万美元 NSF 资助建全自动 AI 化学实验室 — CatAstro_Piyush · 2026-08-27
- 拆解 9 个 Company Brain 项目:它们都由获取、记忆、思考、搜索四部分构成 — femke_plantinga · 2026-08-27
- 411k 插图被切割:用 2900 万参数模型处理大英百科全书 — vanstriendaniel · 2026-08-27
- van der Schaar 实验室:医疗围绕“平均患者”构建会掩盖什么? — MihaelaVDS · 2026-08-27
- VGGT-SLAM++ 开源:基于 DEM 的高频 Sim(3) 视觉 SLAM 系统 — rsasaki0109 · 2026-08-27
- 研究员 kalomaze 批评「pass@512 刷 GSM8K」式论文缺乏批判性 — kalomaze · 2026-08-27