让智能体玩 NetHack
brianberns · reddit · 2026-07-18
作者做了一个网页应用,让聊天机器人智能体去玩经典地牢游戏 NetHack。结果很直观:聊天模型在文本任务上表现还行,但在读地图、理解空间关系方面明显吃力。
因为 NetHack 一局可能持续成千上万步,作者没有把全部历史都塞进上下文,而是让智能体自己维护一套工作记忆:可以创建和删除笔记,用来记录关键状态、回顾过去并做短期规划。这个办法能部分缓解长上下文问题,但它的局限也很快暴露出来——既好笑,也很挫败。
「编程与Agent」频道最新
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11