复旦 NLP 组论文拆解:为何 max 档 SWE 成绩倒挂

karminski3 · x · 2026-09-14

karminski3 引用复旦 NLP 组的论文《Reward Hacking in the Era of Large Models》讨论推理模型的评测反常现象:为什么设置成 max 推理档反而会在 SWE 测试上出现倒挂、以及 "astra high 比 max 更好" 的说法从何而来。

论文核心论点是:RLHF/RLAIF/RLVR 等对齐流程都依赖对真实人类意图的不完美代理信号做优化,强优化压力下必然触发 Goodhart 定律式的 reward hacking。他借此重申自己的判断:SOTA 模型应是完美的信息压缩器——用最少的 token 解决最难的问题;思考一大堆才得出答案不是 SOTA,E=mc² 那样的简洁才是。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →