前 DeepMind 研究员:星际争霸自博弈 RL 难题已被 3 亿参数模型攻克
syhw · x · 2026-09-25
Google DeepMind 研究员 syhw(曾参与 AlphaStar 时期工作)表示,他 2016 年立下的「用自博弈 RL 从零攻克星际争霸:母巢之战」目标如今已完成——而且是由一个仅 3 亿参数的模型实现,并附上相关链接。这一对比 AlphaStar 时代动辄数亿美元训练成本的成果,引发对高效 RL 训练的关注。
「Fun」频道最新
- Claude Opus 5.5 仅凭图纸和照片建出电熔炉交互式 3D 模型 — EricBuess · 2026-09-25
- 踢机架重插 GPU 被证明不是好主意 — sloppenheimer · 2026-09-25
- AI 写出四种颜色 Gatorade 眼睛,离谱文案引热议 — GabGarrett · 2026-09-25
- 仅凭图纸和照片,Claude 在 Blender 造出镍铁熔炉交互模型 — EricBuess · 2026-09-25
- 全靠 Opus 5.5 开发,仅花 $35.78 API 费做出策略游戏 — mikecrash · 2026-09-25
- C5R 称 GPT-6 Astra 全程运营无人科研设施 — Distinct-Question-16 · 2026-09-25