新模型跑分「离谱」:效率直逼 Sol/Opus 水平,RL 基建细节曝光
nrehiew_ · x · 2026-09-11
nrehiew 罕见地讨论基准成绩:某新模型的效率达到「Sol/Opus 级别」,认为数字「insane」。
他随后拆解其 RL 训练基础设施:
- 精心的 dispatch 策略消除长尾停顿;从旧 checkpoint 做 router replay
- 短补全会影响训练早期与 off-policy,方案是在数据集层面设上限并配丢弃机制
- off-policy 通过约束比率与 loss masking 处理;新 checkpoint 更新时 KV 与 router 持久化、不重算
- 训练最后阶段对超过 40 个 teacher 模型做全词表 OPD
所属事件:DeepSeek V4.1 技术报告解读:RL 基建、沙箱与推理栈细节曝光(8 条相关)→
「Infra」频道最新
- k3报告细节:数百万并发沙盒的RL训练规模确认 — stochasticchasm · 2026-09-11
- 五角大楼拟向 AI 云初创 Fluidstack 提供约 50 亿美元贷款 — vitaliychiley · 2026-09-11
- Eric Schmidt:AI 的真正瓶颈不是电力而是钱,万亿美元资本难筹 — rohanpaul_ai · 2026-09-11
- SpaceX 再签 AI 算力大单:月入 11.1 亿美元,年化 ARR 冲 1000 亿 — NinaDSchick · 2026-09-11
- Carmack:Jetson Thor 128GB 内存对实时机器人是过度配置 — ID_AA_Carmack · 2026-09-11
- YC Demo Day 钻石晶圆初创揽 1.6 亿美元意向订单,挑战硅基芯片 — ycombinator · 2026-09-11