设想:让 RL 智能体游玩数百万次,训练可下载权重的生成式游戏
theteknosaur · x · 2026-09-15
作者设想:若自己是 Rockstar CEO,会在《GTA 6》发售后的十年里让强化学习智能体游玩新游戏数百万次,用其游戏过程作训练数据,训练出一个学习运行游戏世界的生成式模型,然后把模型权重卖给玩家——玩家下载权重游玩,游玩即推理。
- 工作室仍负责构建世界、物理与机制,智能体负责探索并生成训练数据
- 每个玩家可能获得工作室从未明确设计过的、独特且更宽广的玩法体验
- 本质上是先构建一个"足够好"的游戏模拟器,用它向神经网络解释游戏
- 若神经渲染(如 DLSS 5)持续进步,可先用更简陋的画面起步,把预算更多投给 RL 训练
「研究」频道最新
- 实测发现次正规浮点数拖慢性能的问题几乎仅存在于 Intel 处理器 — lemire · 2026-09-15
- Adaption AI 推出 Invent API:几行代码生成可商用训练数据集 — sarahookr · 2026-09-15
- 港理工发布以人为中心的智能综述:六层递进框架统一碎片化研究 — jiqizhixin · 2026-09-15
- arXiv 新论文提出 k-鲁棒联盟对齐:弱化条件下的 agent 安全授权 — Aaroth · 2026-09-15
- Arvind Rajeswaran 提出「联盟对齐」弱条件可保证多智能体安全 — Aaroth · 2026-09-15
- 联盟对齐扩展到长时程 MDP:Nash 均衡全部安全 — Aaroth · 2026-09-15