六个决策模型同场打 Pac-Man,jev 1.13 以 2750 均分登顶
facethef · reddit · 2026-10-08
作者用 Pac-Man 实测了六个热门决策模型:kev 1.13、Kev 4B、Clef、Clef Flash、GPT-6 Luna 和 Laya。由于这些模型响应在毫秒级,可以让它们实时游玩。
排行榜结果(每模型跑 100 局取均分,±2 标准误差):
| 模型 | 均分 | 最高分 | 平均延迟 |
|---|---|---|---|
| jev 1.13 | 2,750 | 6,380 | 290 ms |
| GPT-6 Luna | 2,568 | 5,920 | 179 ms |
| Clef Flash | 2,538 | 4,260 | 256 ms |
| Clef | 2,476 | 4,820 | 398 ms |
| Kev 4B | 1,506 | 5,280 | 231 ms |
| Laya | 639 | 1,200 | 104 ms |
jev 1.13 均分最高,但顶部几家在误差范围内并列;Laya 最快但分数最低。项目仓库开源,任何人可接入自己微调的本地或托管决策模型上榜。还支持真人扮演 Pac-Man,让各模型(或混编)担任四只幽灵。
「模型」频道最新
- Mistral Large 4 栽在魔方测试上,Matthew Berman 实测翻车 — Matthew Berman · 2026-10-08
- 数据隐私顾虑升温,越来越多企业转向开源模型与主权 AI — jeremyakahn · 2026-10-08
- OpenRouter实测:GPT-6 Luna成最快Decisions模型,全球延迟180ms — OpenAIDevs · 2026-10-08
- Hugging Face 上线 decision-model 标签,已有 1300+ 决策模型可筛选 — victormustar · 2026-10-08
- Step 5 Preview 上线 Nous Portal,面向 Agent 场景免费一周 — StepFun_ai · 2026-10-08
- 陶哲轩评 OpenAI 数学成果:证明只需几小时,理解仍需数年 — xiaosun86 · 2026-10-08