训练仅奖励结果或导致模型忽视推理过程正确性
A_K_Nain · x · 2026-08-29
针对模型训练机制的讨论指出,如果训练过程仅仅针对“正确答案”给予奖励,而不在乎模型是如何得出该答案的,可能会导致模型学会忽视推理过程的正确性。这引发了关于强化学习(RL)目标函数设计的关注。
「研究」频道最新
- Proteus 开源:Agent 可自主改写源代码的自进化框架 — aigclink · 2026-08-29
- 清华姚班新班主任徐梦迪:只靠 Scaling 无法构建通用机器人 — 量子位 · 2026-08-29
- 零源幻觉检测新方法 HCPD:AUROC 提升 10 个百分点 — 量子位 · 2026-08-29
- LLM 能替代 Embedding 模型?成本高出 1431 倍 — kalyan_kpl · 2026-08-29
- Isaac 0.5 发布: 36B 动态 MoE 开源具身基础模型 — AkshatS07 · 2026-08-29
- Terminal-Bench 3.0 质量控制与基准维护复盘 — ajratner · 2026-08-29