ROME 训练管线拆解:500B token CPT 加两阶段 SFT 与 RL
thisguyknowsai · x · 2026-10-06
系列推文拆解 ROME 三阶段训练管线:
- Stage 1:在 5000 亿 token 的结构化代码任务上做 CPT(持续预训练)
- Stage 2:带错误掩码的两阶段 SFT
- Stage 3:块级优化的 RL
各阶段逐级递进,走的是系统性能力积累路线而非捷径。
所属事件:中国团队开源 ROME+ALE 智能体生态,30B 稀疏模型对标 480B(9 条相关)→
「编程与Agent」频道最新
- t3 code 用多 agent 审 PR:本地即时反馈,CI 约 20 秒部署 — samgoodwin89 · 2026-10-06
- Hugging Face Hub 上线 RL 环境筛选器,支持四大框架 — lmoroney · 2026-10-06
- 前特斯拉AI总监跳槽Anthropic,编码Agent差距被点名 — Kuprel · 2026-10-06
- 「五年内 docx 被 Markdown 取代」引发争论:排版与普通用户怎么办 — bytebot · 2026-10-06
- 一个标签页刷新 Bug 让服务器 CPU 打满四天,根因是请求量随标签页数平方增长 — Ok_Negotiation_2587 · 2026-10-06
- loop-engineering:8 种无人值守 Agent 循环模式,让 AI 整夜跑你的仓库 — JafarNajafov · 2026-10-06