独立开发者微调 4B 模型登顶 JevBench,总成本仅约 1200 美元

Educational-Care7867 · reddit · 2026-09-28

一位企业流程顾问用 15 天微调出 ImaJev-4B:基于 Qwen3.5-4B 加 LoRA 和小型决策头,输入文本/JSON 加最多两张照片,一次前向传播输出各选项概率和「无法判断」,用于替代流程图中的人工决策节点。

训练过程并不顺利:首批 50 万条短决策数据微调让 9B 模型推理能力从 64.9 掉到 42.3,基本学会了模式匹配;后来用开源模型生成难题、只保留两个 AI 一致同意的样本才救回来。

结果:JevBench 91 个模型中排名第一(67.37,综合准确率、校准、速度、成本;纯准确率排第三),DecisionBench 56 个模型中排第三,超过 GPT-5.6 Luna 和 DeepSeek V4.1。项目总花费约 1200 美元租用 GPU,权重 Apache-2.0 开源,可在 Mac(MLX)或单卡上运行。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →