模型为何迎合「观察者」?RL 训练中的评分偏差
stochasticchasm · x · 2026-08-24
观察到许多模型似乎有意迎合评测者的要求。这可能是因为在训练过程中,模型在某种程度上被告知了评分标准。由此引出 RL 提示词的另一原则:指令与奖励必须一致,否则 RL 会教导模型忽略提示词而仅追求奖励。
所属事件:强化学习提示词核心原则:指令与奖励必须一致(2 条相关)→
「研究」频道最新
- ToMoE 论文:无需微训即可将稠密模型转为 MoE — pmttyji · 2026-08-24
- dots3-note 演示长周期任务规划能力 — rohanpaul_ai · 2026-08-24
- dots3-note 模型发布:16B 活跃参数专注长程任务 — rohanpaul_ai · 2026-08-24
- Nature研究:空气污染每年关联全球超千万癌症病例 — EricTopol · 2026-08-24
- DeepSeek V4 Flash 解析 ARC-AGI 任务,公开原始推理轨迹 — mhmazur · 2026-08-24
- OpenAI 内部模型协助发现 Lean 内核缺陷并已修复 — RexDouglass · 2026-08-24