StartLux 自报:27B 模型在 38 项基准中 31 项领先 Jev AI
Dr_Singularity · x · 2026-10-07
StartLux Labs 发布 Decision 系列小模型的自报评测:StartLux-Decision-27B 在 Decision Index 0.2.1 得 63.88,9B 得 58.63,均超过 Jev 1.13 公开榜的 57.91,自称在 38 项基准中 31 项领先。
需注意的细节:
- 所有数字为自报结果,并非官方榜单收录
- 评测使用基准官方工具包,在 H200 GPU 上于 2026 年 9 月 27 日至 10 月 1 日完成
- 仓库含完整 results.md 与机器可读的 summary 文件,并用 4B 模型端到端复跑验证了评测代码
「模型」频道最新
- 用户发现 ChatGPT 手机端语音输出暗藏隐藏指令 — VoidStateKate · 2026-10-07
- Paradigm 从零训练数学模型 Limite 1B-Violetto 并发布技术报告 — tensorqt · 2026-10-07
- ChatGPT 传闻取消免费用户文字聊天上限并升级默认模型 — hey_abusiddik · 2026-10-07
- 5060 Ti 16GB 跑 Qwen3.8 Flash Next IQ1_M:55 tok/s 还能写出像样落地页 — bobaburger · 2026-10-07
- EmbeddingGemma 2 手机端离线跑多模态 RAG,文本仅占 191MB 内存 — Saboo_Shubham_ · 2026-10-07
- Paradigm 发布数学推理模型:7 项高难基准评测套件全开源 — tensorqt · 2026-10-07