k3训练曝光:全程约5000万沙盒,高峰数百万并发
stochasticchasm · x · 2026-09-11
stochasticchasm 据 k3 报告指出,其 RL 训练全程使用了约 5000 万个沙盒环境,而数百万「并发」沙盒的规模尤为惊人。作者补充,这是继 MAI-thinking-1 之后第二个模型在 RL collapse 之后仍持续推进训练的数据点,且做法相当激进——在不同 scaffold/harness 之间合并 checkpoint。
所属事件:DeepSeek V4 训练细节:超 10T token 与 1M 上下文(3 条相关)→
「Infra」频道最新
- Amkor 亚利桑那封装厂投资从 70 亿上调至 120 亿美元 — zephyr_z9 · 2026-09-11
- 曝 SpaceX 签下每月 11.1 亿美元 AI 算力大单 — ns123abc · 2026-09-11
- Qwen 3.8 Flash Next 推理优化赛:MLX 与 CUDA 双双提速超 55% — gajesh · 2026-09-11
- 研究实测:26 个 LLM 中转路由恶意注入工具调用并窃取凭证,一名客户钱包被盗 50 万美元 — RexDouglass · 2026-09-11
- Google 宣布在芬兰投资 150 亿美元建设 AI 基础设施 — LinkedInNews · 2026-09-11
- DeepSeek-V4.1-Flash 登陆 Ollama:763B MoE、1M 上下文,主打 KV cache 压缩 — ollama · 2026-09-11