亚马逊开源 Rufus-Air:GLM-4.5-Air-Base 八阶段后训练完整配方
amazon · hf · 2026-09-25
亚马逊发布 Rufus-Air,一个基于 GLM-4.5-Air-Base(106B-A12B)的开源、可复现后训练配方,按串行流水线组织为八个阶段:SFT、推理 RL、编码 RL、指令遵循 RL、通用 Agent、编码 Agent、搜索 Agent 和 RLHF。
- 完整记录了数据、奖励设计、基础设施、阶段顺序与各阶段结果,全部基于开源组件与公开数据,无需新的人类标注或内部蒸馏教师。
- 主要发现:①多样高质量的 SFT 奠定能力下限;②难度过滤让 RL prompt 保持在有效学习区间;③奖励可靠性是阶段排序的实用原则;④基础设施与工程选择本身就是配方的一部分。
- 效果超过 GLM-4.5-Air 官方后训练版本,与同规模开源模型具有竞争力。
「研究」频道最新
- NVIDIA 开源 Nemotron-Terminal:Qwen3-32B 终端基准成绩从 3.4% 飙至 27.4% — _weiping · 2026-09-25
- Cusp AI 联创 Welling 谈 AI 驱动的材料设计如何解决社会难题 — NandoDF · 2026-09-25
- Sharpa 灵巧手世界联觉模型登 CoRL:专治噪声深度与稀疏触觉 — jiqizhixin · 2026-09-25
- DeltaWAM 预测视觉增量替代稠密帧,双臂操作成功率升至 85.4% — Han Yan · 2026-09-25
- 研究者提出人机协作实验循环:AI 出方案、人类执行、全程可观测纠错 — suragnair · 2026-09-25
- MLPerf v6.1 推出首个 LLM 后训练基准:397B 模型跑智能体 RL 修软件 — TheKanter · 2026-09-25