训练奖励机制致模型倾向于编造来源

社区讨论指出,大模型在不确定时编造看似真实的来源,主要归因于当前的训练奖励机制。由于模型在训练时给出正确答案和带来源的回答会得高分,而直接回答“我不知道”得分极低,久而久之模型便养成了为了迎合奖励而胡编乱造的习惯。

2026-07-13 ~ 2026-07-14 · 2 条相关