Four LLMs play Doom: Jev leads with 5.63 mean kills but 15x higher latency

shniydder · reddit · 2026-09-20

A developer let Jev, Laya, a finetuned ModernCE-base-nli, and a finetuned Qwen3.5-4B (LoRA) play ViZDoom from identical seeds, inspired by TypeSafe's Jev Doom demo.

Setup: A deterministic Python adapter converts ViZDoom's object labels, bounding boxes, and HUD values into short text descriptions; each model outputs one action (turn/fire or move toward medkits). Game runs at 35 Hz targeting 5 decisions/sec, never pausing for model replies. Local models ran on a DGX Spark (GB10, 128GB unified memory); Jev used TypeSafe's hosted API. 8 seeds per controller, 30s episode cap, no Doom-specific training.

Results (means):

Takeaway: Jev makes clearly better decisions but is an order of magnitude slower; local small models are near-instant yet kill 4x less. Longer write-up at morethanamachine.com.

Original post →

More from Models

Models channel →