StartLux 开源 Decision 决策模型:38 项基准 31 项超 Jev
机器之心 · wechat · 2026-10-03
上海初创公司 StartLux(原点星辉,成立不到 5 个月)发布完全开源的决策模型 StartLux-Decision,提供 0.8B/2B/4B/9B/27B 五档及本地量化版本。在 DecisionIndex 0.2.1 的 38 项基准中,27B 版有 31 项超过 Jev 1.13,综合得分 63.88 对 57.91(团队自测口径);与 Jev 1.13 的国际象棋对局 36 局赢 35 局,且响应速度相当。
Decision 模型定位:不做开放式生成,而是直接对开发者给定的候选项做选择、是非判断或评分——客服分流、工具选择、页面下一步操作等。在 Agent 长时间运行中,这类「高频小判断」是调用最频繁的一层。
速度与工程:单卡 H200、BF16 下,4B 一次前向回答三个问题平均 26 毫秒(0.8B 为 12.2 毫秒);使用 CUDA Graph、快速线性注意力算子与多问题合并前向。可输出概率分布,便于置信度路由与人工确认兜底。Q4KM 量化(4B 约 2.71GB)在 231 题复测中与原始权重决策一致率 98.3%。
本地智能分层:StartLux 的体系将 27B 作为通用层、Decision 承担高频判断、上层是 Agent 与 Memory、底层是量化与推理系统,核心是有限本地算力下的精细分配。
AutoResearch 与 RSI:该模型从立项到完成首轮研发仅约 3 天,依托 AI 参与数据构造、训练、评测与失败分析的自动化研发管线(工程自动化率超 95%,核心研究环节 AI 参与约 70%)。CTO 郭权玮提出 RSI 五级划分,公司自定位 Level 3(AutoResearch)。文末指出,Decision 模型路线已成为行业共识:OpenAI 推出 Decisions API、Cloudflare 开源 Clef 等。
「编程与Agent」频道最新
- 开发者晒 AI 生成代码:质量超手写,抵一年工程量 — cnakazawa · 2026-10-03
- 本地字幕工具 mlsubgen:45 种语言、双识别器互校、全离线 — Dodgy_Past · 2026-10-03
- TypeSafe AI 发布实战 cookbook:批量提问省 12.2 倍成本提速 10 倍 — hackgoofer · 2026-10-03
- book-to-skill:把技术书 PDF 转成 Claude Code 技能,省 24-51 倍 token — tom_doerr · 2026-10-03
- 被问能否给垒球缝皮革,Agent 两小时自主搞定微型工厂 — ihorbeaver · 2026-10-03
- 开发者观察:已没人再抱怨 AI 生成的代码注释了 — Aizkmusic · 2026-10-03