FlowBalance:基于验证器的自改进方法,数学推理较 GRPO 平均提升 2.12 分
_akhaliq · x · 2026-09-08
HuggingPapers 转发的论文 FlowBalance 提出一种「验证器锚定的推理模型自改进」方法:
- 在 Qwen3-8B 上,数学推理平均较 GRPO 提升 2.12 分;
- 训练速度更快、稳定性更好,且解的多样性更高。
「研究」频道最新
- Marigold V2 深度估计横扫 NYUv2、KITTI 等五大基准 — AntonObukhov1 · 2026-09-09
- Marigold V2 训练配方:4bit 量化 DiT 加 QLoRA 单卡微调 — AntonObukhov1 · 2026-09-09
- 一张 32GB 消费级显卡微调 Qwen-Image-Edit 变深度估计器,几天搞定 — AntonObukhov1 · 2026-09-09
- Marigold V2 发布:单 GPU 后训练图像生成器做深度估计,入选 SIGGRAPH Asia 2026 — AntonObukhov1 · 2026-09-09
- Marigold V2 发布:单张消费级 GPU 训练的 DiT 深度估计器 — AntonObukhov1 · 2026-09-09
- DeepMind 发布 AlphaGenome Atlas:90 亿单字母变异一网可查 — anshulkundaje · 2026-09-09