研究挑战共识:用户回复里的「这不对/有用」反馈可训练利用

LChoshen · x · 2026-09-03

一项新工作挑战了「用户回复中的反馈信号太噪、难以利用」的普遍看法。模型训练中直接利用用户自然给出的反馈(如「这是错的」「成功了!」)通常被认为噪声大、难以有效使用,但研究者证明这类信号其实可以被有效利用。合作者包括 LChoshen 与 AbendOmri,论文链接见原文。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →