k3训练曝光:全程约5000万沙盒,高峰数百万并发

stochasticchasm · x · 2026-09-11

stochasticchasm 据 k3 报告指出,其 RL 训练全程使用了约 5000 万个沙盒环境,而数百万「并发」沙盒的规模尤为惊人。作者补充,这是继 MAI-thinking-1 之后第二个模型在 RL collapse 之后仍持续推进训练的数据点,且做法相当激进——在不同 scaffold/harness 之间合并 checkpoint。

所属事件:DeepSeek V4 训练细节:超 10T token 与 1M 上下文(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →