训练仅奖励结果或导致模型忽视推理过程正确性

A_K_Nain · x · 2026-08-29

针对模型训练机制的讨论指出,如果训练过程仅仅针对“正确答案”给予奖励,而不在乎模型是如何得出该答案的,可能会导致模型学会忽视推理过程的正确性。这引发了关于强化学习(RL)目标函数设计的关注。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →