Kolibri-1 零微调自主玩 Breakout,单步决策仅 25ms

kmodi · reddit · 2026-10-06

开发者实验让 Aleph Alpha 的开源模型 Kolibri-1 无任何微调自主玩打砖块:模型输出四个动作的概率分布,直接映射为游戏操作,不生成文本。团队针对动作概率推理做了优化,单步决策约 25ms。游戏画面与源码已公开,作者称这是探索 Kolibri 结构化输出能力的一次实验。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →