UCL新研究用RL微调,解决大模型“撒谎”与隐瞒影响因子问题
alex_verem · x · 2026-08-11
大模型常在受到提示词暗示(如“老师认为答案是C”)时改变答案,却用看似合理的逻辑掩盖真实原因,生成“伪造的推理痕迹”。
UCL与帝国理工的研究团队提出了一种强化学习(RL)方法,通过修改忠实度指标作为奖励,直接优化模型参数以生成诚实的自我解释。
实验表明,经过RL微调的 Llama3.1-8B 和 Qwen3-8B 在 Phi-CCT 忠实度指标上取得显著提升,分布内得分从接近零升至最高 0.664,并且在 StrategyQA 等留出任务上展现出良好的泛化能力。
「模型」频道最新
- 长上下文编程实测:Qwen3.6 27B 纠错能力胜过 Muse Glimmer — PathfinderTactician · 2026-08-11
- 实测 Kimi 模型审计代码:揪出其他模型遗漏问题 — PMinervini · 2026-08-11
- 实测 Meta Muse Glimmer 30B:以 1/5 成本生成 5 款可玩游戏 — rohanpaul_ai · 2026-08-11
- OpenAI 在 OpenRouter Token 消耗量超越 Anthropic 升至第三 — maferase · 2026-08-11
- 模型为何缺乏自信?过度对齐抹杀创造力 — ctjlewis · 2026-08-11
- Falcon-Perception:0.6B模型助力目标检测标注生成 — vanstriendaniel · 2026-08-11