模型通关同人游戏「Pokemon Brown」:泛化在涨,但打地鼠式训练仍在
gleech · x · 2026-09-24
研究者 gleech 公布的一系列游戏测试结论:让模型试玩冷门的宝可梦同人游戏「Pokemon Brown」,Astra 用约 1 万步(大致相当于人类 5 小时游戏时长)成功通关,且未表现出对该新游戏的明显记忆,说明其具备真实的泛化能力。
总结性判断:多个模型同时呈现出「记忆化与浅层泛化」的证据,但也有可靠性与对任务变体的容忍度(Astra 尤为突出)——即「通用智能在增强」与「打地鼠式任务专项后训练」两种现象同时存在。
所属事件:Astra 约 1 万步通关冷门宝可梦同人游戏(2 条相关)→
「模型」频道最新
- 网友实测 Opus 用量额度耐用,重置前愣是没用完 — dotey · 2026-09-24
- 深度解析 GPT-6 递归深度传闻:MoE 加递归或成推理新范式 — panic_in_the_galaxy · 2026-09-24
- 不生成文本、号称快 200 倍的决策模型 Jev 引发「格式完美的错误答案算不算幻觉」之辩 — jamesbrooksco · 2026-09-24
- 实测对比:Jev 在准确率、延迟与成本上全面胜过 Gemini Flash — cantrell · 2026-09-24
- 用户因 Opus 5.5 降价留下:吐槽 Anthropic 安全营销双标 — ayushtweetshere · 2026-09-24
- Claude 拒做的步骤 Codex 两度搞定,安全护栏成落地痛点 — ChanceKelch · 2026-09-24