Anthropic 研究员曝光 RL 狂野配置:每步 2.5 万 rollouts

andrew_n_carr · x · 2026-09-22

Andrew Carr 回应他人时指出一个「狂野」的强化学习训练配置:30 步训练、每步 2.5 万个 rollouts、async-4 异步度。他假设听众不懂 RL 配置,解释这种配置为何惊人。

所属事件:激进RL训练配置引热议:30步每步2.5万rollouts(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →