基准分数是对单次片段的证据,不等于胜任一份工作
Shahules786 · x · 2026-09-03
Shahules 的 Paper Club 线程(1/6)核心论点:基准分数是关于一次任务片段的证据,不是对整份工作的证明——分数常比结论本身更「精确」。讨论两篇同指此问题的论文:Salesforce 与伊利诺伊大学的 CRMArena Pro,以及哈佛/斯坦福的 Designing Benchmarks for Knowledge Work。模型可以在狭窄切片上得高分,却仍不具备该工作周围的真实能力。后续各条展开 CRMArena-Pro 的构建、结果与局限,以及知识工作基准的报告标准。
所属事件:CRMArena-Pro 基准显示顶级 Agent 多轮 CRM 任务成功率大跌(4 条相关)→
「研究」频道最新
- 蒸馏疑云再补刀:SFT+RL 组合让「偷懒蒸馏」说法站不住脚 — JoshPurtell · 2026-09-03
- 训练数据真靠蒸馏?博主质疑某模型蒸馏自 sol 的说法 — JoshPurtell · 2026-09-03
- 微调文本编码器破解 Ideogram 4 横幅并提升自然语言遵循 — mrjackspade · 2026-09-03
- 长程 agent 难靠蒸馏,数据合成难度天差地别 — JoshPurtell · 2026-09-03
- AI 创业者提出「信任天花板」:数万亿美元价值卡在不可信的 ML 上 — williamtp · 2026-09-03
- TDmol 用 2D 分子结构做桥梁,文本引导 3D 生成相似度提升 41% — bravo_abad · 2026-09-03