前沿模型在真实编码环境后训练,一轮成本约 5 万美元
willccbb · x · 2026-07-29
这条转发的核心信息是:把前沿规模模型放进真实编码环境做后训练,并没有想象中那么不可承受。
帖子里给出的数字很具体:
- 一次 GLM-5 步骤可在 131k 上下文 下,用 28 个节点 在 5 分钟内 跑完
- 如果做 1000 步,租算力成本大约 5 万美元,周期约 3 天
内容重点还包括 Prime Intellect 团队在做的开源工具:verifiers 和 Prime RL。作者强调,eval 本身就是切入点——环境和评测在逻辑上是同一个单位,所以做产品卫生检查的人,其实已经离 post-training 很近了。文中还提到 verifier 架构重构:把环境拆成 task set / harness / runtime 三部分,方便在不同训练任务中组合使用。
「编程与Agent」频道最新
- ClaudeDev 称无状态 MCP 可部署到 serverless 和边缘 — IndraVahan · 2026-07-29
- Eve 上线 CLI 集成注册表,直接安装 agent 扩展 — shadcn · 2026-07-29
- Agentic AI 峰会设分论坛讨论 Agent 开发平台 — dawnsongtweets · 2026-07-29
- Agent Farm 把文档和记忆当作会衰减的农田来维护 — jasonkneen · 2026-07-29
- Agent Farm 把编程智能体的 worktree 管理做成了亮点 — jasonkneen · 2026-07-29
- 一个 Unity RPG prompt,把多智能体循环推到 AAA 级极致 — chongdashu · 2026-07-29