开源模型逼近 TypeSafe Jev:Shisa DE-1 仅差 6 分,部分任务持平

drdanielbender · x · 2026-09-28

开发者 jtdavies 复现了 LangWatch 基准(11 个任务),在 M5 Pro Mac mini 上跑完 15 个开源权重模型,检验它们与 TypeSafe 决策模型 Jev 的差距:

距 Jev 发布不到两周,开源模型追平速度惊人,小模型做决策任务的可行性进一步被验证。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →