StartLux 开源 Decision 决策模型:38 项基准 31 项超 Jev

机器之心 · wechat · 2026-10-03

上海初创公司 StartLux(原点星辉,成立不到 5 个月)发布完全开源的决策模型 StartLux-Decision,提供 0.8B/2B/4B/9B/27B 五档及本地量化版本。在 DecisionIndex 0.2.1 的 38 项基准中,27B 版有 31 项超过 Jev 1.13,综合得分 63.88 对 57.91(团队自测口径);与 Jev 1.13 的国际象棋对局 36 局赢 35 局,且响应速度相当。

Decision 模型定位:不做开放式生成,而是直接对开发者给定的候选项做选择、是非判断或评分——客服分流、工具选择、页面下一步操作等。在 Agent 长时间运行中,这类「高频小判断」是调用最频繁的一层。

速度与工程:单卡 H200、BF16 下,4B 一次前向回答三个问题平均 26 毫秒(0.8B 为 12.2 毫秒);使用 CUDA Graph、快速线性注意力算子与多问题合并前向。可输出概率分布,便于置信度路由与人工确认兜底。Q4KM 量化(4B 约 2.71GB)在 231 题复测中与原始权重决策一致率 98.3%。

本地智能分层:StartLux 的体系将 27B 作为通用层、Decision 承担高频判断、上层是 Agent 与 Memory、底层是量化与推理系统,核心是有限本地算力下的精细分配。

AutoResearch 与 RSI:该模型从立项到完成首轮研发仅约 3 天,依托 AI 参与数据构造、训练、评测与失败分析的自动化研发管线(工程自动化率超 95%,核心研究环节 AI 参与约 70%)。CTO 郭权玮提出 RSI 五级划分,公司自定位 Level 3(AutoResearch)。文末指出,Decision 模型路线已成为行业共识:OpenAI 推出 Decisions API、Cloudflare 开源 Clef 等。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →