Base Labs 复现实验:RL 性能增益主要来自简单题与修复死循环

baseten · x · 2026-10-06

Base Labs 每周发布团队进展。本周研究了 RL 训练的低维结构,验证「早期更新的 rank-1 外推」等近期发现是否成立。结论:性能提升主要来自更容易的问题和修复 doom loops(死循环),而更难的环境不那么容易被线性外推。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →