Paradigm 揭秘后训练关键:程序生成+LLM 出题的互补合成数据组合
tensorqt · x · 2026-10-07
Paradigm 分享其数学模型后训练经验:提升高度依赖组合两种互补的合成数据生成机制——
- 程序化生成(procedural generation):可精确控制难度与正确性
- 基于 LLM 的问题构造(LLM-based problem formulation):带来多样性与新颖性
两者结合才在后训练中获得显著收益,单独使用任一种效果有限。
「研究」频道最新
- 研究者提出 World Editing:不生成新世界而是编辑已有世界 — yuntiandeng · 2026-10-07
- 新研究追问:Agent 替你行动时,它到底站在谁那边 — ZacharyHuang12 · 2026-10-07
- RL 研究年度 Top 10 榜单出炉,Spurious Rewards 居首 — ShayneRedford · 2026-10-07
- SciConBench 团队:每两月跑一轮评测,寻找资金维持公开榜单 — manoelribeiro · 2026-10-07
- 动态基准 SciConBench:AI 合成医学结论 61–90% 含事实错误 — manoelribeiro · 2026-10-07
- SciConHarness 屏蔽答案来源,逼模型真合成而非检索 — manoelribeiro · 2026-10-07