Base Labs 复现实验:RL 性能增益主要来自简单题与修复死循环
baseten · x · 2026-10-06
Base Labs 每周发布团队进展。本周研究了 RL 训练的低维结构,验证「早期更新的 rank-1 外推」等近期发现是否成立。结论:性能提升主要来自更容易的问题和修复 doom loops(死循环),而更难的环境不那么容易被线性外推。
「研究」频道最新
- 华为诺亚提出 Tail-Influence Sampling:策略评估 CVaR 估计误差最高降 76% — huawei-noah · 2026-10-06
- Google 发布 KeyRec:仅用 10% 视觉 token 预算搞定长视频与流式理解 — google · 2026-10-06
- 4DCodeBench 基准:前沿模型能重建静态场景却搞不定动态物理 — 4DCodeBench · 2026-10-06
- OmniTask 论文:生成数据训练确能提升理解任务表现 — WeijiaShi2 · 2026-10-06
- 牛顿证乘积法则不用极限:离散对称差分让高阶项神奇消失 — ctjlewis · 2026-10-06
- DeepMind 从零设计酶:一酶产药靶分子效率高 99 倍,一酶 90°C 降解塑料 — 141_1337 · 2026-10-06