PufferLib 5.0 强化学习超脚本智能体 5 倍,登顶 NetHack
jsuarez · x · 2026-09-14
jsuarez 转发其暑期实习生的成果:用 PufferLib 5.0 训练的强化学习智能体在 NetHack 上取得超过此前 SOTA 5 倍的成绩,并击败了最好的手写脚本智能体 AutoAscend。原推附长文介绍:NetHack 是长时序、部分可观测、一次意外交互即可终结整局的高难度游戏,对强化学习极为严苛,文章详述了如何用 RL 打破 AutoAscend 的 NetHack Challenge 纪录。
所属事件:PufferLib 5.0 连刷 Craftax 与 NetHack 强化学习纪录(4 条相关)→
「研究」频道最新
- Stanford/MIT 研究:同一模型换 harness 跑分可差 6 倍 — burkov · 2026-09-15
- 数学家临近重大突破却被 AI 抢发,开源科学模式遭拷问 — ScottNover · 2026-09-15
- ECCV 论文 ART 攻克复杂妆容迁移,发布首个 2K 真实妆容数据集 — jiqizhixin · 2026-09-15
- 数学家为何抵触 AI 证题?不止护饭碗,还有更深一层的道理 — rbhar90 · 2026-09-15
- CCN2026 辩论录像:NeuroAI 能否成为理解大脑与心智的必经之路 — aran_nayebi · 2026-09-15
- 仅 5 小时数据全盒训练,让机器人抓取光照盒也能泛化 — DominiqueCAPaul · 2026-09-15