开源模型 Kolibri-1 零微调玩转 Breakout,单次决策仅 25ms
Nils_Reimers · x · 2026-10-06
Aleph Alpha 开源的 Kolibri-1 模型被开发者用于自主玩雅达利游戏 Breakout,全程无需微调、不生成文本。
- 技术路径:模型读取弹球与挡板的坐标数据,对四个候选动作打分,取最高概率作为下一步。推理走 vLLM 的 pooling/classification 路径,用 classifierfromtoken(nopostprocessing) 把 LM 输出权重拷贝为分类头,单次决策约 25ms。
- 细节:输入是模拟器坐标而非像素;挡板跟随策略写在 prompt 里;预留 256 个单 token 标签。
- Tesseracted Labs 把 Kolibri-1 免费托管上线了一个共享街机页面,任何人无需 GPU 即可围观模型实时决策,系统提示词和完整输出都公开可看。
所属事件:开源模型 Kolibri-1 零微调自主玩转打砖块(2 条相关)→
「编程与Agent」频道最新
- Agent 速度优化:最好跑分也最难靠集群取胜 — ducha_aiki · 2026-10-06
- vibe coding 两年后的选型反思:Cursor+Lovable 撑不起真生意 — Fun-Tangerine5264 · 2026-10-06
- HyperBrowseComp 发布:13 种语言 423 题压测浏览 agent — zmkzmkz · 2026-10-06
- Cloudflare 推出 agent 优先的 CLI 工具 cf,八项举措打破可观测性黑箱 — dinasaur_404 · 2026-10-06
- 开源项目 celld:自托管版 Cloudflare Workers,每个 AI Agent 一个 Cell — letandrewcook · 2026-10-06
- 664 次 agent 实测:9 条规则减少 29% 思考且零任务损失 — PilgrimofHaqq2 · 2026-10-06