一个 demo 把 RL policy 训练和可视化搬进 tldraw
max__drake · x · 2026-07-25
有人展示了一个把 RL policy 的训练和可视化放进 tldraw,而且还能离线运行 的 demo。
帖子虽然很短,但核心思路很明确:把强化学习策略的开发、观察和调试放到一个更接近画布式协作工具的界面里,而不是传统机器学习 notebook。它既像一个研究工程原型,也像一个工具链实验。
「编程与Agent」频道最新
- 开发者构建全自主 AI 新闻室,MiniMax M3 日耗数十亿 Token — robleclerc · 2026-07-25
- 开发者迁移 Mac 到 iPhone,几天烧掉 20 亿 token — nicolascraske · 2026-07-25
- Elicit 将演示用 API 和 MCP 驱动研究型 Agent — elicitorg · 2026-07-25
- 做 ChatGPT 的 MCP 连接器时,测试服务端仍然很慢 — Think-Ad986 · 2026-07-25
- 过去一年 subagent 实践,被作者总结成 Swarm Coding — rseroter · 2026-07-25
- 一个侧边栏快捷操作,可把 AI 编程会话平铺成网格 — PaulShellDev · 2026-07-25