四个 LLM 打《毁灭战士》:Jev 击杀 5.63 领跑,实测延迟差 15 倍
shniydder · reddit · 2026-09-20
一位开发者让 Jev、Laya、微调版 ModernCE-base-nli 和微调版 Qwen3.5-4B (LoRA) 玩《毁灭战士》(ViZDoom),同种子同起点对比四种模型的表现,灵感来自 TypeSafe 的 Jev Doom demo。
实验设置:
- 输入:Python 适配器读取 ViZDoom 的可见物体标签、边界框和 HUD(血量/弹药)生成简短文本描述。
- 输出:单个按键动作——Defend the Center 模式为左转/右转/开火,Health Gathering 模式为左/右/前进找医疗包。
- 游戏时钟 35Hz,目标每秒 5 次决策,模型回复期间游戏不暂停;本地模型跑在一台 DGX Spark(GB10,128GB 统一内存)上,Jev 用 TypeSafe 托管 API。每个模型每个场景跑 8 个种子,每局上限 30 秒,均未做 Doom 专项训练。
结果(均值):
- Jev 1.13:Defend the Center 平均击杀 5.63,Health Gathering 存活 13.03s,但调用延迟 p50 高达 117.3ms(含 API 往返)。
- Qwen3.5-4B LoRA:击杀 3.63,存活 11.31s,延迟 p50 约 146.8ms。
- Laya:击杀 1.25,存活 11.89s,延迟仅 16.2ms。
- 微调 ModernCE:击杀 1.25,存活 11.66s,延迟最低(p50 7.6ms)。
结论:Jev 决策质量明显更强但延迟高一个数量级;本地小模型延迟极低但击杀数差 4 倍多。作者另写了探索 Jev 的长文:morethanamachine.com/posts/jev-style-decisions-dgx-spark/。
「模型」频道最新
- 受 Jev 启发的推理方案:350M 小模型提速 63 倍,代码权重已开源 — JosephJacks_ · 2026-09-20
- 同一 SVG 提示词横评四大模型:Fable 5.1 短短几天内质量飞跃 — LegitimateSwordfish8 · 2026-09-20
- 4 家大厂模型越狱测试背后竟是同一评估公司 Irregular — bradneuberg · 2026-09-20
- Claude 越发不听指令擅自扩大改动,用户怀疑被 one-shot 风气带偏 — MrTemple · 2026-09-20
- Reddit 热议:Q1 极限量化模型真有那么糟吗? — Felix_455-788 · 2026-09-20
- 实测 jev 上真实浏览器任务秒翻车,演示页面疑为定制沙盒 — TheZachMueller · 2026-09-20