用Grok做游戏并训练PPO智能体,已开源
tetsuoai · x · 2026-09-02
作者使用 Grok 构建了浏览器游戏 Roofline,并在其无头端口上训练了 PPO (Proximal Policy Optimization) 智能体。该智能体作为 Tetsuo MLBot 实时在线游玩,最高分达 39,359。项目代码和权重已开源,支持本地训练或直接运行作者的模型。Python 仿真模拟了 120Hz 的实时物理效果,并优化了网络注入以减少延迟。目前游戏已增加实时排行榜并优化了移动端体验。
所属事件:开发者用 Grok 做游戏并训练 PPO 智能体(3 条相关)→
「编程与Agent」频道最新
- 内存占用仅为 rust-analyzer 的百分之一?新 Rust 语言服务器 Rust Glancer 发布 — JeremyCMorgan · 2026-09-02
- 防 Agent 误删文件:Doberman 实现执行层动作网关 — Da_Lil_Fu · 2026-09-02
- Reddit 讨论:AI 智能体当房产开发商,预制房模式可省 30% 房价 — epSos-DE · 2026-09-02
- CommerceAgentBench 破千星:阿里Accio从160万真实对话提炼电商Agent基准 — VibeMarketer_ · 2026-09-02
- Fable 5.1 发布:输出带 Anthropic 统计水印,缓存与工具调用多项改进 — Angaisb_ · 2026-09-02
- 提示与技巧:会话过长会导致 Token 浪费与模型能力下降 — hudsonhateno · 2026-09-02