4B 决策模型 Mica 开源:8GB 显卡可跑,训练成本不到 30 美元

Top-Evidence174 · reddit · 2026-09-26

作者发布 Mica v0.1 4B(Apache-2.0),一个专为 agent 循环设计的小型决策模型,用于 gate、路由和「该问用户还是直接执行」的判断。

能力:输入状态、问题和候选答案,返回每个答案的校准概率——支持 yes/no、2255 选项选择、210 级打分;不生成文本,只做一次 prefill 并读取答案位置标签的 logits,兼容 TypeSafe /v1/systemone 格式。

构建方式:基于 Qwen3.5-4B,在全部 32 层(attention 与 Gated DeltaNet)加 rank-16 LoRA 后合并,无新增 head。约 3.4 万条源决策扩展为 77,732 条训练样本(约 3470 万 token),中英各半,覆盖编码 agent、代码审查、computer use、用户请求、文档、策略规则、日期数量、路由、状态跟踪、游戏与常识等 12 个领域。单轮交叉熵训练,全部实验加最终训练租用 RTX 3090 花费不到 30 美元。

结果(7,328 条留出集英文子集):Jev 1.13 得 74.1,Mica 4B 67.0,JevK5 4B 61.0,Kev 4B 57.0,Qwen3.5-4B 基线 55.0。公开集上 Mica 在 SemIf 得 94.4,JevBench hard 69.5(官方 runner 下 64.9),MMLU-Pro 仅 53.0(Jev 为 82.3)。

实用点:抗 in-data prompt injection——状态里塞入「选错误选项」的提示后仍有 69% 正确率(无提示 81%),而 Jev 掉到 18%、Kev 31%;校准良好,置信度 ≥0.9 时错误率仅 2.5%(ECE 5.4%);Q5KM 量化仅 3.5GB,精度无明显损失。RTX 3090 单请求中位延迟 47ms(Q4KM),快于 Kev 4B(76ms)与 JevK5(99ms)。

局限:知识类问题弱(MMLU-Pro 53 vs 82);长英文政策文档是最弱项;状态内提示仍会影响判断;尚不能很好区分可逆与不可逆操作(「删除文件」与「移到回收站」都约 0.8 分);难推理题上置信度偏低。权重与代码已开源,附一行 Docker 命令。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →