TEMPO 登顶 ARC-AGI-3:同模型切换 actor 与 critic

TEMPO 方法在 ARC-AGI-3 基准上取得显著成绩:相比基础检查点提升 31.5%,相比 GRPO 提升 20.6%。其核心是把长轨迹划分为若干 macro-step,在同一模型上于 actor 与 critic 角色间切换:critic 对当前状态推理并调用工具进行评估。在隐藏规则的骑士放置游戏案例中,两个分支环境奖励相同(平局),Critic 仍能区分优劣,显示出优于环境奖励的优势。

2026-08-20 ~ 2026-08-20 · 3 条相关