315M自弈RL机器人Pluto零封GPT-6 Astra,曾胜职业选手
i_dg23 · x · 2026-10-05
备受关注的 LLM 打星际争霸挑战以一边倒告终:GPT-6「Astra」对顶级人类编写的星际争霸 bot Pluto 打出 0-1000。
- Pluto 是 315M 参数的 Transformer/RNN 混合模型,用类似 AlphaStar 的自博弈强化学习训练,基本是 tscmoo(Vegard Mella,Meta 研究员)的个人项目
- 它在 IEEE CoG 2026 上对其他 bot 胜率 98%,并击败过多名《母巢之战》职业选手,一个非官方版本曾打到天梯全球第 5
- 为把 BW 变成 RL 环境,tscmoo 用 3 万多行 C++ 完美重写了游戏核心引擎(OpenBW),大部分代码写于 2016 年、早于 LLM 辅助编程
- 作者指出 Pluto 并非不可利用,Astra 未能偷到几局颇为遗憾,或许 GPT-7 该自己训练深度 RL 模型来复仇
所属事件:315M机器人Pluto零封GPT-6 Astra 星际对决一边倒(2 条相关)→
「研究」频道最新
- 开源 Rust 引擎 gamfit:一条公式拟合 GAM,自动选平滑参数 — Sauers_ · 2026-10-05
- Llama 3.1 8B 微调医疗决策模型:逐字段准确率 84%,全对仅 30% — Forsaken_Cut8542 · 2026-10-05
- 上海交大发布 LIFT:VLA 零力标注预训练,后训练注入力觉高频反应 — jiqizhixin · 2026-10-05
- LOOM 让循环 MoE 稳定跑到 9-12 层循环,iso-FLOP 反超标准 MoE — SonglinYang4 · 2026-10-05
- 论文被 ACML 2026 接收却因无钱交注册费考虑撤稿 — Jealous_Key_4030 · 2026-10-05
- CMU 提出 TailRL:优化奖励上尾概率,让 RL 少陷次优解 — ceciletamura · 2026-10-05