MoReBench 与LLM评测讨论

raphaelmilliere · x · 2026-07-11

作者围绕 **MoReBench** 和“pivot penalty”展开讨论,重点是 LLM 评测研究中的方法问题: - 他认为团队在 MoReBench 上投入了大量工作,但受限于篇幅,论文里只能放入有限的实验。 - 他提到自己很喜欢做**经验性的 LLM 评估**,并说从第一次和 ChatGPT 对话起,就对模型在**道德推理**上的表现印象深刻。 - 但真正的难点在于:这类能力**很难测量**,而且“到底该测什么”本身就不清晰。 - 他还提到自己最近看的一篇后续论文,认为也很有意思。

所属事件:MoReBench引发LLM评测方法讨论(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →