MoReBench 与LLM评测讨论
raphaelmilliere · x · 2026-07-11
作者围绕 **MoReBench** 和“pivot penalty”展开讨论,重点是 LLM 评测研究中的方法问题: - 他认为团队在 MoReBench 上投入了大量工作,但受限于篇幅,论文里只能放入有限的实验。 - 他提到自己很喜欢做**经验性的 LLM 评估**,并说从第一次和 ChatGPT 对话起,就对模型在**道德推理**上的表现印象深刻。 - 但真正的难点在于:这类能力**很难测量**,而且“到底该测什么”本身就不清晰。 - 他还提到自己最近看的一篇后续论文,认为也很有意思。
所属事件:MoReBench引发LLM评测方法讨论(2 条相关)→
「研究」频道最新
- 递归语言模型靠短任务训练,却泛化到长 8—32 倍任务 — heghbalz · 2026-07-21
- SIGGRAPH 论文展示点云场景的快速 signed distance 计算 — keenanisalive · 2026-07-21
- Andrew Ng 发布 1 小时课程,讲 agentic knowledge graphs 与 Google ADK — blaizedsouza · 2026-07-21
- 南加州大学提出 TOPL:逐 token 离策略学习泛化到 11 个摘要集 — UniversityofSouthernCalifornia · 2026-07-21
- OpenAI 内部模型据称可自主解出单位距离问题,成功率 48% — inductionheads · 2026-07-21
- 从 Jacobian 猜想根部导出的显式反例对象 — kevrussell · 2026-07-21