DATPO:难度自适应树状策略扩展 RLVR 推理覆盖范围

Youngjun Yu · hf · 2026-09-10

DATPO(Difficulty-Adaptive Tree-Structured Policy Optimization)针对 RLVR 中推理覆盖不足的问题,采用难度自适应的树状 rollout 结构,以句子熵引导分支,并结合多样性感知优化,扩展大模型的推理探索范围。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →