70个开源复现决策模型同基准零样本分类成绩公布
bibryam · x · 2026-10-05
作者发布了一个「Decision Index」,对 70 个开源复现的 TypeSafe Jev「Decision Model」在同一套基准上做零样本分类测试,并汇总成索引图表。该榜单让社区可以横向比较这些开源模型在相同条件下的分类表现,但帖子正文未附具体名次与数字,细节需查看原始链接。
「模型」频道最新
- 开发者自称神秘系统 agentic 基准 100% 准确,连自己也看不懂 — examachine · 2026-10-05
- 开发者吐槽:Opus 拒修 GLM5.3 发现的安全漏洞 — lucasmeijer · 2026-10-05
- 端侧语音识别模型 Whistle 登上 Hugging Face 热榜 — Cactus-Compute · 2026-10-05
- OpenAI 护栏现「systems are thinking」新话术,疑涉人工审核 — Darpinian · 2026-10-05
- AI去噪图像分数相近,衍射斑点恢复率却大不同 — bravo_abad · 2026-10-05
- KOL 实测 GPT 操控 Safari:像真人一样用浏览器几乎不出错 — kimmonismus · 2026-10-05