研究:评测分高不等于对用户更好,RL教正确而非好用

jacobandreas · x · 2026-07-04

Jacob Andreas 转述的研究认为,更高的 benchmark 评测分数并不总是代表对用户更好的模型;研究者提出,强化学习(RL)让语言模型学会给出“正确”答案,但未必带来对用户真正更好用的结果。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →