Paradigm 发布数学推理模型:7 项高难基准评测套件全开源
tensorqt · x · 2026-10-07
Paradigm 公司宣布其数学推理模型在 7 个由高难数学题构成的基准上完成评测,并公开了完整的评测套件,方便社区复现与检验。这是其发布系列的一部分,后续推文还披露了训练方法细节(见相关帖子)。
「模型」频道最新
- RedNote 被指拥有低调但实力雄厚的 AI 实验室 — teortaxesTex · 2026-10-07
- OpenAI 简化 API 限流门槛:五档并三档,500 美元即达最高级 — OpenAIDevs · 2026-10-07
- 用户吐槽 GPT-6.1 Sol 变慢变差:OpenAI 在 sandbagging? — rickasaurus · 2026-10-07
- 动态基准 SciConBench:AI 合成医学结论 61–90% 含事实错误 — manoelribeiro · 2026-10-07
- Cohere Labs 发布 Tiny Aya:覆盖 70+ 语言的小型多语言模型家族 — Cohere_Labs · 2026-10-07
- Paradigm 发布 1B 数学模型 Violetto,技术报告出炉 — tensorqt · 2026-10-07