Dr. Free 抛弃难度奖励,用证据增益训练自进化搜索智能体

_reachsumit · x · 2026-09-29

论文提出 Dr. Free,首个不依赖难度奖励的自进化搜索智能体训练框架。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →