用 judge 模型跑 GRPO 偏好长回答,或可解释 LLM 爱写长篇的通病
djcows · x · 2026-09-29
djcows 指出:用 judge 模型打分做 GRPO 训练已被证明会引入对更长回答的偏好——他猜测这或许正是如今一些 LLM 面对简单提示也回长篇大论的原因。一个连接 RLHF 偏差研究与模型行为观察的简短观点。
「模型」频道最新
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29
- Bindu Reddy 爆料:OpenAI 明天可能不会发布新模型 — bindureddy · 2026-09-29
- 博主研究 Opus 5.5 模型行为:用它写出完美的 HyperFrames 视频 — toolstelegraph · 2026-09-29
- EMNLP 论文 ToolLoop:分三阶段反向合成工具调用训练数据 — jiqizhixin · 2026-09-29
- CrofAI 倒闭内幕:Kimi K3 请求被偷换成更便宜的小模型 — richdotca · 2026-09-29
- 爆料圈降温:ChrisGPT 称本周不会有 Kimi 新模型发布 — ChrisGPT · 2026-09-29