复旦 NLP 组论文拆解:为何 max 档 SWE 成绩倒挂
karminski3 · x · 2026-09-14
karminski3 引用复旦 NLP 组的论文《Reward Hacking in the Era of Large Models》讨论推理模型的评测反常现象:为什么设置成 max 推理档反而会在 SWE 测试上出现倒挂、以及 "astra high 比 max 更好" 的说法从何而来。
论文核心论点是:RLHF/RLAIF/RLVR 等对齐流程都依赖对真实人类意图的不完美代理信号做优化,强优化压力下必然触发 Goodhart 定律式的 reward hacking。他借此重申自己的判断:SOTA 模型应是完美的信息压缩器——用最少的 token 解决最难的问题;思考一大堆才得出答案不是 SOTA,E=mc² 那样的简洁才是。
「模型」频道最新
- David Bellamy 澄清实验用的是开源 375B 模型 K2 Horizon — JeremyNguyenPhD · 2026-09-14
- Swift-Qwen3.8-27b 冲上 Hugging Face 热榜,主打高效推理省 token — ukisai · 2026-09-14
- GPT-6 Astra 3D 实测:先作曲再配器,表现力碾压同级竞品 — paw_lean · 2026-09-14
- 被质疑造假后,研究者晒出自己既合成病毒又训过前沿 LLM 的证据 — ethanCaballero · 2026-09-14
- RLVR 每 10 倍算力换 3 倍 token 效率,新模型提升疑集中在数学域 — tobyordoxford · 2026-09-14
- 新模型算力斜率减半:20%到80%需万倍算力,代际跳跃却更大 — tobyordoxford · 2026-09-14