全本地训练 0.8B/2B 决策模型,2B 得分 83.1% 追平 Jev
Usual_Maximum7673 · reddit · 2026-09-29
开发者用纯本地硬件复现了 TypeSafe 的 Jev 实验,开源 Apache 2.0 的「Jeff」系列 Qwen3.5/Gemma 微调模型:一次前向输出各选项的校准概率,不生成文本,专为快速 System 1 判断设计。
- 2B 模型在五项基准(BBH、Financial PhraseBank、JudgeBench、RAGTruth、WinoGrande)平均 83.1%,超过 Jev 公布的 83.0%(AutoJev-27B 为 84.9%);0.8B 为 79.1%
- 训练数据:DGX Spark 上用 Qwen3.8-Flash-Next 生成约 31k 合成题 + 27.1 万公开数据集转换题,无闭源模型输出;单卡 RTX PRO 6000 训练 0.8B 仅 2 小时
- 速度:0.8B 在 M4 Max 上单次决策约 28–29ms,远快于 Jev 的 212ms API 调用;作者在语音导航场景微调后达 24ms 近 100% 准确
- 零样本游戏测试:Doom 击杀数 6.55 追平 Jev(且提示词未给瞄准规则),但 BBH 多步推理 64–68% 远低于 Jev 的 94%
结论:小模型当不了推理机,但是极快的判断器;权重与代码已开源,兼容 Jev API。
「Infra」频道最新
- exe.dev 取消按席位计费:企业改按算力池付费,个人版降至 $15/月 — davidcrawshaw · 2026-09-29
- exo 个人版降价至 $15/月:2 vCPU/4GB,不再送 tokens 改绑 ChatGPT 订阅 — davidcrawshaw · 2026-09-29
- Swift 1.5 + HyperQwen:RTX 3090 上任务耗时降 37%、跑出 100+ tok/s — KingGongzilla · 2026-09-29
- 单卡 DGX Spark 跑 Qwen3.8 Flash 212 tok/s,作者开源完整 vLLM 配方 — DimeRhyme · 2026-09-29
- Reddit 热议:千元级本地跑 SOTA 模型的设备是下一个大机会 — Robert__Sinclair · 2026-09-29
- SemiAnalysis:6000 个数据中心项目仅 3 个受暂停令影响 — MatthewBerman · 2026-09-29