Learn2Play Bench:LLM Agent从陌生环境学规则的能力大考
NationalUniversityofSingapore · hf · 2026-10-09
- NUS 团队发布 Learn2Play Bench:一组全新设计、规则新颖甚至反直觉的文本游戏,规则不在指令里也非预训练熟悉,迫使 agent 通过交互学习而非套用既有知识;提供可复现反馈与自动评分,并跨游戏实例考察迁移。
- 三个发现:
- 保留完整原始记录(动作+反馈)比把经验总结成规则/策略更能支持有效学习;
- 人机差距:顶尖人类玩家峰值得分更高,探索策略更多样、重复动作更少;
- Harness 重要:固定底座模型时,换 harness 可在提升成绩的同时降低推理成本。
「编程与Agent」频道最新
- 开源创意 Agent Open-Voyager:视频/设计领域的 Codex — matchaman11 · 2026-10-09
- 给 AI 智能体一个空 3D 世界:它们自建村庄甚至撰写宪法 — pkmital · 2026-10-09
- 头部 agent 团队也在抄 codex:上下文管理才是 agent 第一难题 — aigclink · 2026-10-09
- 博主用多智能体协作搭出 24 小时 AI 新闻电视台,即将开源 — vista8 · 2026-10-09
- Agent Arena 榜单:Claude Opus 5.5 居首,GPT 6 Astra 紧随其后 — arena · 2026-10-09
- anti-slop 规则集爆火:给 AI 编码代理过滤「AI 味」输出 — tom_doerr · 2026-10-09