GPT-6 Astra 第 3 次尝试通关 NetHack,史上首个 LLM 通关记录
emollick · x · 2026-09-25
Ethan Mollick 转述:GPT-6 Astra 在第 3 次尝试中通关了 NetHack,可能是首个 LLM agent 的通关记录。博客作者 Kenny 记录了全过程:模型于 9 月 21 日以矮人女武神 CodexDelver 之名,在 Hardfought 服务器的终端里经 37,140 回合完成 ascension。
- NetHack 是最难的 roguelike 之一,测试的是「知道」与「做到」的差距:模型能完美解释抗性、物品管理和怪物交互,却常在地图信息过期、菜单打开时执行失败
- 作者 1 月的最优自建 harness 只到地下 10 层;他原以为需要精心手调界面与上下文,结果获胜 agent 是自己搭的 harness,作者一行代码没写
- 三次运行过程可查看服务器 dump;此前 BALROG benchmark 也系统研究过 LLM 在 NetHack 上的知识-执行落差
所属事件:GPT-6 Astra 第三次尝试通关 NetHack 创 LLM 首例(3 条相关)→
「编程与Agent」频道最新
- 有人把本地 LLM 当电脑主界面:装机、配 GRUB 都靠对话完成 — Forward_Jackfruit813 · 2026-09-25
- Agent 循环跑在哪、怎么失败:一篇讲透会话持久化的工程文章 — tempNull · 2026-09-25
- 像素画 prompt 被封装成 pixel-anims skill 开源,附更多示例 — majidmanzarpour · 2026-09-25
- 网友用 Opus 5.5 一段 prompt 纯代码生成会动的像素法师 — majidmanzarpour · 2026-09-25
- 用 Opus 5.5 搭建可视化 Claude Code 编排界面,agent 们下班后自己开工 — EricBuess · 2026-09-25
- System 1 模型 Jev 正在改变记忆与上下文工程的做法 — julianweisser · 2026-09-25