Meta-agent 训练指导在 TerminalBench-2 上把 GRPO 收益翻倍

shi_weiyan · x · 2026-07-23

这条说的是 meta-agent 不只可以在执行时编排 agent,还能反过来指导 RL 训练:通过提供更好的逐步奖励,帮助训练过程变得更有效。

作者声称,这种做法在 TerminalBench-2 上把 GRPO 的收益提升翻倍,说明 meta-agent 既能做运行时优化,也能做训练期的上层优化。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →