四模型同跑 Doom 实测:Jev 平均击杀 5.63 倍碾压微调 Qwen3.5
shniydder · reddit · 2026-09-20
作者让 Jev、Laya、微调版 ModernCE-base-nli 和 LoRA 微调 Qwen3.5-4B 各自玩同一颗种子的 ViZDoom,对比「Defend the Center」和「Health Gathering」两个场景。
- 输入:Python 适配器把 ViZDoom 的可见物体标签、边界框和 HUD(血量/弹药)转成简短文本描述;输出为单个按键动作,约每秒 5 次决策,游戏不暂停等模型。
- 本地模型跑在一台 DGX Spark(GB10,128GB 统一内存)上,Jev 走 TypeSafe 托管 API;所有模型均未做 Doom 专项训练。
- 8 个种子平均:Jev 在 Defend the Center 平均击杀 5.63,远超 Qwen3.5-4B 的 3.63、Laya 和 ModernCE 的各 1.25;生存时间(Health Gathering)四者差距不大(13.0s vs 11.3s)。
- 延迟差异显著:Laya p50 约 16ms、ModernCE 约 8ms,而 Jev 因 API 往返达 117ms、Qwen 约 147ms。
结论方向:Jev 的决策质量明显占优但延迟代价高;小模型延迟极低但游戏表现一般。作者附了完整流程与更长的 Jev 探索文章。
所属事件:四模型实测玩《毁灭战士》:Jev 击杀 5.63 领跑(2 条相关)→
「模型」频道最新
- 阶跃星辰疑似上新:Step-5-Preview BF16 权重悄然现身 Hugging Face — adefa · 2026-09-20
- 跑千万 token 模拟实验,5 美元赠送额度还没用完 — DeryaTR_ · 2026-09-20
- 用户抱怨 Codex「重置文化」:付费后仍不敢用,盼改成可预测额度 — TheMoonMidas · 2026-09-20
- Andrew Chen:比通用 LLM 便宜 400 倍,广告支撑的免费 AI 应用将成可行 — andrewchen · 2026-09-20
- B站「AI无限竞技场」:190个视频真实任务实测100多个模型 — vista8 · 2026-09-20
- 用户实测:干一上午活建完新 App,额度竟还剩 78% — TheMoonMidas · 2026-09-20