开源模型逼近 TypeSafe Jev:Shisa DE-1 仅差 6 分,部分任务持平
drdanielbender · x · 2026-09-28
开发者 jtdavies 复现了 LangWatch 基准(11 个任务),在 M5 Pro Mac mini 上跑完 15 个开源权重模型,检验它们与 TypeSafe 决策模型 Jev 的差距:
- 最好的 Shisa DE-1 平均分仅落后 Jev 约 6 分,多个任务上持平或反超
- 4B 级模型仅再落后几分,本地推理每决策约 120ms
- 用 Matthew Berman 视频的 9 个用例对比,Shisa 与本地复现的 Jev 方法几乎打平(5 平、各 2 胜),速度约为其一半
距 Jev 发布不到两周,开源模型追平速度惊人,小模型做决策任务的可行性进一步被验证。
「Infra」频道最新
- OriginTrail DKG V10.0.19 上线:AI Agent 读图更快更省 CPU — melnykowycz · 2026-09-29
- INT21 称两周造 20 个推理引擎,MiMo 解码达 1308 tokens/s — bingxu_ · 2026-09-29
- 用 Amazon Nova Act 做合成监控:告别脆弱 UI 选择器脚本 — AWS ML Blog · 2026-09-28
- NVIDIA 展示 Qwen 27B 模型输出速度达每秒 2529 tokens — IanAndrewsDC · 2026-09-28
- Textract 适配器跨账户生命周期管理:参数外置实现零停机换版 — AWS ML Blog · 2026-09-28
- 分析者:Muse 是 CPU 密集实现个例,不宜作代理估算 Agent 算力 — BenBajarin · 2026-09-28