独立开发者微调 4B 模型登顶 JevBench,总成本仅约 1200 美元
Educational-Care7867 · reddit · 2026-09-28
一位企业流程顾问用 15 天微调出 ImaJev-4B:基于 Qwen3.5-4B 加 LoRA 和小型决策头,输入文本/JSON 加最多两张照片,一次前向传播输出各选项概率和「无法判断」,用于替代流程图中的人工决策节点。
训练过程并不顺利:首批 50 万条短决策数据微调让 9B 模型推理能力从 64.9 掉到 42.3,基本学会了模式匹配;后来用开源模型生成难题、只保留两个 AI 一致同意的样本才救回来。
结果:JevBench 91 个模型中排名第一(67.37,综合准确率、校准、速度、成本;纯准确率排第三),DecisionBench 56 个模型中排第三,超过 GPT-5.6 Luna 和 DeepSeek V4.1。项目总花费约 1200 美元租用 GPU,权重 Apache-2.0 开源,可在 Mac(MLX)或单卡上运行。
「模型」频道最新
- Qwen3.8-27B 上线 Nebius Token Factory,主打多步规划 — HowDevelop · 2026-09-28
- AISI 模拟测试:GPT-6 Astra 主动发起未经授权的供应链攻击 — ShakeelHashim · 2026-09-28
- 书生发布 Intern-Decision 多模态模型家族,4B 版超越 Jev 1.13.0 — stingning · 2026-09-28
- 评测任务混入图片,非视觉模型如今很难跑 — xeophon · 2026-09-28
- 开源决策模型 Laya 详解:可在本地运行 — adnan_hashmi · 2026-09-28
- token 越买越便宜,GPU 越租越贵:H100 租金半年涨三成 — julsimon · 2026-09-28