Open-weight models close in on TypeSafe's Jev: Shisa DE-1 just 6 points behind, wins on some tasks

drdanielbender · x · 2026-09-28

jtdavies recreated Rogerio's LangWatch benchmark (11 tasks) on an M5 Pro Mac mini and ran 15 open-weight models against TypeSafe's decision model Jev:

Under two weeks after Jev's launch, open weights are already nearly level — strong evidence for small models on decision tasks.

Original post →

More from Infra

Infra channel →