研究者让前沿 AI 玩宝可梦,测量分布外泛化能力
scaling01 · x · 2026-09-24
研究者 gleech 等人想弄清当前前沿模型「分布外」泛化能力有多强——即解决从未见过的问题的能力,以判断 AI 进展速度。他们选择让多个 AI 玩宝可梦游戏作为测试场景,观察模型在陌生规则环境中的推理与适应表现。
「模型」频道最新
- 开发者感叹 Claude 5.5 好用到「重新粉上 Claude」 — haydendevs · 2026-09-24
- ChatGPT 语音打通邮箱日历 Slack,支持 GPT-6 Astra 等新声 — steipete · 2026-09-24
- Together 开源 Tev1-4B 实验版权重,演示自训决策模型有多简单 — togethercompute · 2026-09-24
- 数学家称获无限 token,推测是 OpenAI 慷慨重置 Codex 额度 — JacquesThibs · 2026-09-24
- 仅花 17 美元微调出自己的类 Jev 分类模型 — nutlope · 2026-09-24
- Claude Opus 4.7 登陆 OpenRouter:1M 上下文,5/25 美元定价 — repligate · 2026-09-24