Meta 研究:RL 后训练反而降低大模型多轮任务测试时扩展性

dair_ai · x · 2026-10-04

Meta Superintelligence Labs 的新论文发现一个反直觉现象:在 BFCL v4 多轮、ACEBench、WebShop 等 agentic 任务上,带轻量 harness 的基座模型在大采样数下往往比 RL 后训练版本解决更多任务。

要点:

所属事件:Meta 提出「锐化税」:RL 后训练削弱大模型测试时扩展能力(5 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →