Dev swaps Gemini 3.1 for Jev as LLM judge: 200x cheaper, 50x faster, same accuracy

indragie · x · 2026-09-25

Developer rbro112 reports one week after moving an eval judging dataset from Gemini 3.1 to Jev by @typesafeai:

Not everything is perfect, with details in the original thread. A useful data-point for anyone running LLM-as-judge pipelines.

Original post →

More from Models

Models channel →