1451 条已验证 DeepSeek 推理链开源:MIT 协议、去污染、面向小模型蒸馏
Paramecium_caudatum_ · reddit · 2026-09-19
作者发布了一个 MIT 协议的开源数据集:1451 条来自 DeepSeek V4.1 Flash 最大推理强度的高难度数学题推理链,总计 1160 万推理 token,单条平均约 8k token(最长 119k),专为小推理模型的 SFT/蒸馏设计。
构建流程:
- 从 SynthLabsAI/Big-Math-RL-Verified 的 53,740 道竞赛题出发,去重与质量过滤后剩 49,387 题
- 仅保留可验证闭式答案、来源与基准不重叠、难度带 llama8b 解题率 ≤0.2 的题目,分层抽样 2000 题
- DeepSeek V4.1 Flash 以 2500 并发生成,1810 万 token 仅用约 9 分钟(208 tok/s)
- pass@1 为 78.5%,仅保留 1537 条正确答案中的最终 1451 条
两层验证: sympy 代码判分器直接匹配 1462/1957,其余 495 条交给本地 Qwen3.5-4B 判官——判官只负责'救回'等价答案,不放水,还借此发现并修复了判分器的 3 个 bug。
去污染: 用 Qwen3-VL-Embedding-8B 嵌入对 MATH-500(cos ≥0.94)与 993 道 AIME 题(1983–2026)做匹配,剔除 86 条近似重复。
已声明的局限: 只验证最终答案未逐步审查 CoT;单一教师模型风格同质;嵌入去重是近似而非证明;gold 答案继承自父数据集,可能有少量错误。87 条超 30k 思考 token 的长链也适合做长程推理评测。
「研究」频道最新
- openjev 基准改稿:提高准确率权重,新增概率校准维度 — airesearch12 · 2026-09-19
- Meta 开源 spmd_types:为分布式训练设计的 SPMD 类型系统 — austinvhuang · 2026-09-19
- Cosmos DB 团队 VLDB 论文:更优调度策略年价值可达上亿美元 — blaizedsouza · 2026-09-19
- 争论:预训练数据之外,验证环节才是 AI 缺失的关键跃迁 — gerardsans · 2026-09-19
- 51 分钟微调的 GLiNER 完胜 Jev:专用分类器碾压通用模型 — rickasaurus · 2026-09-19
- 评测可信度根源在封闭:学者提出 Eval Card 与公开评测仓库方案 — evijit · 2026-09-19