用宝可梦测前沿模型泛化:Astra 通杀随机地图与同人作,新模型多靠记忆
gleech · x · 2026-09-24
Paradigm 3 团队(Niccolò Zanichelli、Gavin Leech、Peli Grietzer)用统一轻量脚手架让前沿模型打宝可梦,考察分布外泛化能力。
主要发现:
- 新模型进步明显:Fable、Opus 5、Sol、Astra 都能快速稳定解开 Rock Tunnel 难关,而 GPT-5.5 与 Opus 4.8 通常失败。
- 但公开网络上存在海量宝可梦攻略数据,且可能已有宝可梦专属 RL 环境,记忆污染是评估大坑;新模型对关键剧情节点的回忆也明显增强。
- 作者设计了两个「挤出分布」测试:①打乱地图布局的随机变体——Sol 和 Opus 5 在 Rock Tunnel 变体上性能崩塌,Astra 完全不掉点;②冷门同人游戏 Pokemon Brown——Astra 用约 1 万步(约人类 5 小时游戏量)通关,且未见明显记忆迹象。
- 行为差异:新一代 Claude 会认真打所有战斗,OpenAI 模型则尽可能跳过战斗。
结论: 多数模型呈现记忆化与浅层泛化,但也观察到可靠性与对任务变体的容忍度提升(尤其 Astra);即存在「通用智能提升」与「打地鼠式任务特定后训练」并存的证据。
「模型」频道最新
- 网友实测 Opus 用量额度耐用,重置前愣是没用完 — dotey · 2026-09-24
- 深度解析 GPT-6 递归深度传闻:MoE 加递归或成推理新范式 — panic_in_the_galaxy · 2026-09-24
- 不生成文本、号称快 200 倍的决策模型 Jev 引发「格式完美的错误答案算不算幻觉」之辩 — jamesbrooksco · 2026-09-24
- 实测对比:Jev 在准确率、延迟与成本上全面胜过 Gemini Flash — cantrell · 2026-09-24
- 用户因 Opus 5.5 降价留下:吐槽 Anthropic 安全营销双标 — ayushtweetshere · 2026-09-24
- Claude 拒做的步骤 Codex 两度搞定,安全护栏成落地痛点 — ChanceKelch · 2026-09-24