新表征方法显著提升 NetHack 与 Craftax 强化学习成绩
GlenBerseth · x · 2026-09-28
Roger Creus 展示近期工作:通过学习更合适的表征(representations),在 NetHack 和 Craftax 等困难探索型 RL 基准上可以取得远好于以往的成绩。Glen Berseth 转发并建议更新数据。具体方法细节见其论文。
「研究」频道最新
- 估算:粗略描述人体生物学需千亿亿字节,超全球存储千倍 — IgorCarron · 2026-09-28
- SkillGym 用 2756 个技能环境微调,Qwen3.5 小模型超 Claude Sonnet 4.6 — dair_ai · 2026-09-28
- RL 的边界:没有评分函数就没有信号,"学习"是被夸大的行业话术 — gerardsans · 2026-09-28
- 信息几何:从合成几何视角精确刻画 Chernoff 信息 — FrnkNlsn · 2026-09-28
- d9bench:测试决策模型掷九面骰的概率是否均匀 — swishfever · 2026-09-28
- 研究:LLM 仅凭目录等结构化元数据即可重建文档全文 — ChuckDBrooks · 2026-09-28