OpenAI与Anthropic曾小规模暂停RL训练

有推文引述消息称,OpenAI和Anthropic都曾进行过一次小规模的强化学习(RL)训练暂停,作者将其称为「追赶前沿的成功故事」,并建议下次应主动进行而非被动发生。同期讨论中,「pacing the frontier」(控制前沿发展速度)这一政策术语被广泛认可,多位推动者受到致谢,有人认为这一造词将载入史册。

2026-09-01 ~ 2026-09-01 · 3 条相关