40 亿参数模型拿下 IMO 基准 54%,成本仅为大模型 1/3
SergioPaniego · x · 2026-08-22
一个 40 亿参数的模型在 IMO-ProofBench 上达到了 54% 的准确率,可与比它大 7-50 倍的模型竞争,且每个问题的成本低 3 倍。
核心技术方案:
- 纯后训练:不涉及预训练算力投入。
- 蒸馏 SFT:利用知识蒸馏进行监督微调。
- GRPO:结合评分标准的强化学习优化。
- 推理缓存:利用缓存机制进行测试时的精细化推理。
「模型」频道最新
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24
- Sakana AI 翻译模型日英评测超越 Google 与 DeepL — SakanaAILabs · 2026-08-24
- 不服 theo 的模型梯队榜,开发者 haider 自制一份自己的版本 — haider1 · 2026-08-24
- 神秘OxAlpha碾压Claude,阿里800亿港元押注AI — 创业邦 · 2026-08-24
- OpenAI谷歌掀大模型降价潮,智谱神秘模型碾压Claude — 创业邦 · 2026-08-24
- 今日AI圈速览:DeepSeek周末半价、GPT-5.6 Sol降价、阿里配售800亿投AI — APPSO · 2026-08-24