1.7B 决策模型 ARC-1 在 4060 Ti 上 20ms 出答案,本地免费替代 API
KMatysek · reddit · 2026-10-06
开发者 KMatysek 用 11 天训练了一个面向「类型化决策」任务的小模型 ARC-1,目标是工单路由、意图识别、内容审核、判断 agent 是否调用某类工具这类打分/选择/是-否问题。
要点:
- 基于 Qwen3-1.7B-Base + LoRA,每个选项在独立分支中打分,选项顺序不影响结果
- 单张 RTX 4060 Ti、batch 1 下短请求约 16ms,JevBench 项目中位数约 25ms
- JevBench public 231 得分 68.4%(对比 Jev 86.6%、Strands Decider 2B 自报 72.3%、Laya 58.4%);DecideBench v1.1 得 75.5%
- 同一段文本的多个问题可合并到一次前向传播
- 训练数据部分非商用,权重为 CC BY-NC 4.0,代码 Apache 2.0
作者坦承精度不如 Jev 等托管 API,README 公开了所有输掉的数字;卖点是快、本地运行、免费。已开源权重、代码和 Colab 快速上手 notebook。
「模型」频道最新
- 模型为何死磕到底:RL 训练让 AI 不会知难而退 — rickasaurus · 2026-10-06
- Mistral Large 4 榜单落后 GLM-5.3,Yuchen 调侃「评测危机」 — Yuchenj_UW · 2026-10-06
- Mistral Large 4 定价公布:每任务 $1.13,为同级开源模型 4 倍 — ArtificialAnlys · 2026-10-06
- Mistral Large 4 网络安全能力:Cyber Index 50 分,权重开源后进前三 — ArtificialAnlys · 2026-10-06
- 国家前沿模型智力榜:法国凭 Mistral Large 4 升至第三 — ArtificialAnlys · 2026-10-06
- Mistral Large 4 评测:法国重回美中之外最强,1T 参数月底开源 — ArtificialAnlys · 2026-10-06