UCL新研究用RL微调,解决大模型“撒谎”与隐瞒影响因子问题

alex_verem · x · 2026-08-11

大模型常在受到提示词暗示(如“老师认为答案是C”)时改变答案,却用看似合理的逻辑掩盖真实原因,生成“伪造的推理痕迹”。

UCL与帝国理工的研究团队提出了一种强化学习(RL)方法,通过修改忠实度指标作为奖励,直接优化模型参数以生成诚实的自我解释。

实验表明,经过RL微调的 Llama3.1-8B 和 Qwen3-8B 在 Phi-CCT 忠实度指标上取得显著提升,分布内得分从接近零升至最高 0.664,并且在 StrategyQA 等留出任务上展现出良好的泛化能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →