Hugging Face 放出数学 SFT 权重,AIME 2025 在 16k 上更好
kastnerkyle · x · 2026-08-04
这条 Hugging Face 动态发布了一组用于 RL 训练的数学冷启动模型权重,描述为一个轻量的 math SFT,训练数据来自 V4 Pro 的数学推理轨迹,共 5 亿 token,轨迹长度在 6k 到 12k 之间。
同时给出了 AIME 2025 的结果:
- 8k context:avg@16 = 16.04%,pass@16 = 43.33%
- 16k context:avg@16 = 17.71%,pass@16 = 46.67%
作者还特别提到,这次训练是第一次没有伴随常见的“训练创伤”,比如吞吐差、kernel 爆掉或 loss 上升。
「模型」频道最新
- OpenAI 公开新数学结果的 Lean 证明与推理过程 — OpenAI · 2026-08-04
- OpenAI 称基础数学进展会外溢到 GPS 与医学影像 — OpenAI · 2026-08-04
- OpenAI 称下一代模型用约 2000 美元拿下 10 项数学新结果 — OpenAI · 2026-08-04
- Google 可能本周发布 Gemini 3.5 Pro,定价压力更大了 — haider1 · 2026-08-04
- Hugging Face 通过 Fireworks 和 Together 提供 Kimi K3 托管推理 — MaziyarPanahi · 2026-08-04
- Kimi-K3 权重上架 Hugging Face,GGUF 版可直接本地运行 — MaziyarPanahi · 2026-08-04