PufferLib 5.0 在 Craftax 强化学习任务达成双倍 SOTA 性能
jsuarez · x · 2026-09-14
作者 daphnesolves 发文介绍用 tabula rasa 的 on-policy 强化学习把 Craftax 打到 level 6:策略单集总回报 162,约为理论最大回报的 71%,能学会造盔甲、释放火球并击败大量敌人。
jsuarez 引用指出,配合 PufferLib 5.0 后在该任务上的 RL 性能相比原结果翻倍(double SOTA)。PufferLib 是以极高训练吞吐著称的强化学习库,5.0 版本在 Craftax 这类稀疏奖励长时序环境上继续展现出显著加速与性能收益。
所属事件:PufferLib 5.0 连刷 Craftax 与 NetHack 强化学习纪录(4 条相关)→
「研究」频道最新
- Stanford/MIT 研究:同一模型换 harness 跑分可差 6 倍 — burkov · 2026-09-15
- 数学家临近重大突破却被 AI 抢发,开源科学模式遭拷问 — ScottNover · 2026-09-15
- ECCV 论文 ART 攻克复杂妆容迁移,发布首个 2K 真实妆容数据集 — jiqizhixin · 2026-09-15
- 数学家为何抵触 AI 证题?不止护饭碗,还有更深一层的道理 — rbhar90 · 2026-09-15
- CCN2026 辩论录像:NeuroAI 能否成为理解大脑与心智的必经之路 — aran_nayebi · 2026-09-15
- 仅 5 小时数据全盒训练,让机器人抓取光照盒也能泛化 — DominiqueCAPaul · 2026-09-15