数据混合算法 On-Policy Mix 入选 NeurIPS,贯通预训练到指令微调
alexisjross · x · 2026-09-25
研究者 michahu8 宣布三项工作入选 NeurIPS,核心是 On-Policy Mix:针对持续学习中「如何随数据变化找到最优数据配比」这一未解难题,提出一种适用于预训练、中期训练和指令微调全阶段的数据混合算法,作者附六条推文长贴详解。
「研究」频道最新
- NeurIPS 2026 论文 SkillRL:7B 模型胜 GPT-4o 41%,靠技能进化 — cihangxie · 2026-09-25
- NVIDIA 开源 Cascade RL 获 NeurIPS Oral,IOI 银牌超越 DeepSeek-R1 — _weiping · 2026-09-25
- 研究者警告:Neuralese 潜空间推理架构将大幅加剧 AI 失对齐风险 — RyanGreenblatt · 2026-09-25
- VeriTile:用 Lean 形式化验证 Triton GPU 内核,AI 智能体自动写正确性证明 — KaiyuYang4 · 2026-09-25
- 掷骰子测出模型软肋:Jev 预测 83% 概率却只有 19% 准确率 — kh-ai · 2026-09-25
- Code Metal 设四项研究奖,单项最高 4 万美元资助形式化验证 — toddhooper · 2026-09-25