PufferLib 5.0 在 Craftax 强化学习任务达成双倍 SOTA 性能

jsuarez · x · 2026-09-14

作者 daphnesolves 发文介绍用 tabula rasa 的 on-policy 强化学习把 Craftax 打到 level 6:策略单集总回报 162,约为理论最大回报的 71%,能学会造盔甲、释放火球并击败大量敌人。

jsuarez 引用指出,配合 PufferLib 5.0 后在该任务上的 RL 性能相比原结果翻倍(double SOTA)。PufferLib 是以极高训练吞吐著称的强化学习库,5.0 版本在 Craftax 这类稀疏奖励长时序环境上继续展现出显著加速与性能收益。

所属事件:PufferLib 5.0 连刷 Craftax 与 NetHack 强化学习纪录(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →