开源 ninfer 跑 Qwen3.8 27B 复刻 Jev 决策 API,准确率 84.4% 接近官方
Unlucky-Message8866 · reddit · 2026-09-21
楼主受 Jev 热潮启发,用自研 ninfer 框架在 Qwen3.8 27B 上混搭多个开源实现,做出 Jev 风格的原生决策 API,完整跑通 JevBench v1.2 公开集(231 个分型决策任务)。
关键结果
- 总体准确率 84.4%(195/231),官方 Jev 1.13.0 为 86.6%;easy 档 100%,original 97.2%,hard 档 69.4%
- 校准极好:ECE 0.045(10 bins)、Brier 0.081
- 延迟 p50 127ms / p95 699ms(RTX 5090,3 并发),hard 档尾部延迟主要被 3.7k token 的 prefill 主导
- 按类型看:adversarial 与 routing-hard 100%,trap 88%;最弱是 temporal-numeric(33%)和 probability(50%)
- 在公开集准确率上已超过 SemIf、djev 等多数已发布系统,仅略低于 Jev 官方与 SemIf
作者自评这是「很脏的 POC」,仍有分配错误等 bug 待修;模型权重发布在 HuggingFace(knoopx/Swift-Qwen3.8-27B-NInfer)。
「模型」频道最新
- 三天内连发四款决策模型,开源圈掀起罕见竞速 — arpit_bhayani · 2026-09-21
- 曝 OpenAI 备战 GPT-6 Sol/Luna,Anthropic 将推 Opus 5.5 — daniel_mac8 · 2026-09-21
- Grok 4.7 发布,细节待官方说明 — koltregaskes · 2026-09-21
- Medmarks 医疗榜更新:Gemma 4 31B 领跑中型开源模型 — iScienceLuvr · 2026-09-21
- PlotWeaver 开训泛非语音模型:覆盖 68 种非洲语言、44 国 11 亿用户 — madeofAjala · 2026-09-21
- LangChain 解读:为什么说 Jev 是「系统一」模型 — LangChain · 2026-09-21