GPS让RL后训练更省算力

机器之心 · wechat · 2026-07-11

这篇工作提出 GPS(GeneralizablePredictivePromptSelection),目标是在 RLVR 后训练中减少昂贵的 rollout 成本,同时保持甚至提升推理能力。

核心思路

主要结果

额外发现

实验范围

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →