4B 决策模型 Mica 开源:8GB 显卡可跑,训练成本不到 30 美元
Top-Evidence174 · reddit · 2026-09-26
作者发布 Mica v0.1 4B(Apache-2.0),一个专为 agent 循环设计的小型决策模型,用于 gate、路由和「该问用户还是直接执行」的判断。
能力:输入状态、问题和候选答案,返回每个答案的校准概率——支持 yes/no、2255 选项选择、210 级打分;不生成文本,只做一次 prefill 并读取答案位置标签的 logits,兼容 TypeSafe /v1/systemone 格式。
构建方式:基于 Qwen3.5-4B,在全部 32 层(attention 与 Gated DeltaNet)加 rank-16 LoRA 后合并,无新增 head。约 3.4 万条源决策扩展为 77,732 条训练样本(约 3470 万 token),中英各半,覆盖编码 agent、代码审查、computer use、用户请求、文档、策略规则、日期数量、路由、状态跟踪、游戏与常识等 12 个领域。单轮交叉熵训练,全部实验加最终训练租用 RTX 3090 花费不到 30 美元。
结果(7,328 条留出集英文子集):Jev 1.13 得 74.1,Mica 4B 67.0,JevK5 4B 61.0,Kev 4B 57.0,Qwen3.5-4B 基线 55.0。公开集上 Mica 在 SemIf 得 94.4,JevBench hard 69.5(官方 runner 下 64.9),MMLU-Pro 仅 53.0(Jev 为 82.3)。
实用点:抗 in-data prompt injection——状态里塞入「选错误选项」的提示后仍有 69% 正确率(无提示 81%),而 Jev 掉到 18%、Kev 31%;校准良好,置信度 ≥0.9 时错误率仅 2.5%(ECE 5.4%);Q5KM 量化仅 3.5GB,精度无明显损失。RTX 3090 单请求中位延迟 47ms(Q4KM),快于 Kev 4B(76ms)与 JevK5(99ms)。
局限:知识类问题弱(MMLU-Pro 53 vs 82);长英文政策文档是最弱项;状态内提示仍会影响判断;尚不能很好区分可逆与不可逆操作(「删除文件」与「移到回收站」都约 0.8 分);难推理题上置信度偏低。权重与代码已开源,附一行 Docker 命令。
「编程与Agent」频道最新
- Hamel Husain 开播填写 AI 工程技术 Tier List,直播聊 Evals 分级 — HamelHusain · 2026-09-26
- dhh:人类独自审查关键代码将很快被视为极不负责任 — deliprao · 2026-09-26
- 网友做 Grok 机器人打包 750GB 开源模型,一键下载可本地运行 — RachelVT42 · 2026-09-26
- Codex 宕机后:他用 Claude Code 监控,再用 Jev 决定何时查 — Yuchenj_UW · 2026-09-26
- 用 Claude Opus 5.5 一次生成 promo 视频,开发者称视频动画已被解决 — JosephJacks_ · 2026-09-26
- dhh 用 Opus 5.5 一次将 Rust 移植为 x86-64 汇编,快 17 倍 — zack_overflow · 2026-09-26