FlowBalance:基于验证器的自改进方法,数学推理较 GRPO 平均提升 2.12 分

_akhaliq · x · 2026-09-08

HuggingPapers 转发的论文 FlowBalance 提出一种「验证器锚定的推理模型自改进」方法:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →